미국 시간 9월 22일, AI 업계에 한 시간 차 맞불이 붙었어요.
앤트로픽이 클로드 오퍼스 5.5를 공개하고 한 시간쯤 뒤에 오픈AI가 GPT-6 솔과 GPT-6 루나를 내놨대요10. 둘 다 앞세운 건 똑같았어요. 성능은 조금 올리고 값은 크게 내렸다는 거예요. 외신은 이날을 두고 "최전선 AI 경쟁이 가격 비교 단계에 들어섰다"고 썼어요15.
그런데 두 발표문을 나란히 읽으면 이상한 데가 있어요.
오픈AI는 솔을 클로드 오퍼스 5와 비교했어요. 업무 자동화 시험에서 오퍼스 5보다 높은 점수를 오퍼스 5 비용의 9%로 냈다고요2. 앤트로픽은 오퍼스 5.5를 GPT-6 아스트라, GPT-5.6 솔과 비교했어요. 기본 설정의 오퍼스 5.5가 최고 설정의 아스트라를 작업당 비용 5분의 1쯤으로 이겼다고요1.
같은 날 나왔으니 당연하지만 서로의 새 모델과는 한 번도 붙지 않은 거예요.
해커뉴스도 갈렸어요. 솔 발표 글에는 "오퍼스 5.5가 더 나은 것 같은데요? 누가 두 점수를 나란히 붙여 줄 수 있나요"라는 댓글이 달렸고, 바로 옆에서는 "이 가격이면 누가 클로드를 쓰는지 모르겠다"는 댓글이 나왔어요12. 오퍼스 발표 글에는 "이러면 페이블은 왜 쓰나요"라는 반응까지 붙었고요11.
그럼 둘을 붙이면 누가 이길까요? 🤔
아무도 안 붙여 봤으니 직접 붙였어요. 세 모델에게 똑같은 한국어 숙제를 내고 판마다 세 번씩 돌렸어요. 걸린 시간과 쓴 토큰을 재고 공식 가격표로 원화 비용까지 계산했어요.
AI를 잘 몰라도 괜찮아요. 결과물은 실물 그대로 보여 드리고, 낯선 말이 나오면 노란 상자에서 바로 풀어 드릴게요.
오늘의 대진표
가벼운 일에서 무거운 일 순서로 짰어요.
회사에서 AI에게 맡기는 일은 대개 짧은 글부터 시작해요. 공지 한 장, 메일 한 통 같은 거요. 그다음이 숫자를 다루는 일이고, 제일 오래 걸리는 게 눈에 보이는 결과물을 만드는 일이에요. 대진표도 이 순서예요. 뒤로 갈수록 AI가 쓰는 토큰이 늘어나요.
채점 규칙은 하나예요. 결과물이 채점표에서 같은 점수면 돈을 덜 쓴 쪽이 이겨요. 회사에서 둘 중 하나를 고를 때도 결국 이렇게 고르니까요.
솔의 동생 루나도 게스트로 같이 뛰어요. 값이 솔의 20분의 1이라 체급이 달라요. 그래서 점수에는 넣지 않고 기록만 남겨요.
이번 경기, 왜 직접 치렀냐면요
점수표만으로는 가려지지 않았거든요.독립 평가 기관 아티피셜 애널리시스는 오퍼스 5.5를 종합 점수 58점으로 1위에 올렸어요. 그런데 같은 페이지에 이런 말도 있어요. 시험을 치르는 동안 토큰을 2억6000만 개 썼는데 비슷한 모델들의 중간값은 8800만 개라 말이 아주 많은 편이라고요. 시험 한 번 치르는 데 8,708달러가 들었대요13.
솔 쪽 평가도 한 줄로 안 끝나요. 같은 기관은 솔이 종합 점수에서는 GPT-5.6 솔과 비슷하고 작업당 비용은 절반쯤이라고 했어요. 그런데 직업별 실무 과제 시험에서는 점수가 오히려 떨어졌대요. 결과물이 짧아지면서 요구한 항목을 빠뜨린 경우가 많았다고요14.
점수 높은 선수는 돈을 많이 쓰고 싼 선수는 몇몇 과목에서 점수가 떨어져요. 이러면 "내 일에는 뭐가 맞나"는 점수표로 답이 안 나와요.
그래서 이 블로그에서 실제로 하는 일을 숙제로 냈어요. 한국어로 쓰고, 한국어로 계산하고, 그림을 그리는 일이에요. 영어 시험 점수로는 알 수 없는 게 한국어 일에서는 드러날 수 있거든요.

오늘의 세 선수
1P. 클로드 오퍼스 5.5 🟧
앤트로픽의 새 5.5 가족 가운데 처음 나온 모델이에요. 앤트로픽은 대부분의 일에서 한 단계 위인 페이블 5.1만큼 해내면서 평소 작업 기준으로 오퍼스 5보다 40% 적게 든다고 발표했어요1. 특이한 점이 하나 있어요. 생각하는 단계를 끌 수 없어요. 문제가 쉬워 보여도 먼저 생각을 조금 하고 답해요. 기본 추론 강도는 중간(medium)이에요16.
2P. GPT-6 솔 ⬛
오픈AI 최상위 모델 아스트라보다 한 단계 아래 모델이에요. 이달 초에 나온 아스트라와 비슷한 방법으로 훈련했어요2. 가격을 GPT-5.6 솔의 할인가에서 다시 절반으로 내린 게 이번 발표의 핵심이에요. 추론 강도는 끄는 것부터 최대까지 여섯 단계로 고를 수 있고 기본은 중간이에요5.
게스트. GPT-6 루나 🔳
솔의 동생이자 오픈AI 모델 가운데 가장 싼 축이에요. 100만 토큰당 입력 0.1달러, 출력 0.5달러예요4. 오픈AI가 이보다 싸게 판 건 성능이 훨씬 낮았던 예전 초소형 모델 둘뿐이었대요10.



생각을 못 끄는 선수 🟧 vs 값을 반으로 깎은 선수 ⬛
계체량. 가격표부터 올려 볼게요 ⚖️
경기 전에 몸무게부터 재요. 점수는 없어요.| 100만 토큰당 | 오퍼스 5.5 | 솔 | 루나 |
|---|---|---|---|
| 입력 | 4달러 (약 5,406원) | 2달러 (약 2,703원) | 0.1달러 (약 135원) |
| 출력 | 20달러 (약 2만7028원) | 10달러 (약 1만3514원) | 0.5달러 (약 676원) |
| 캐시 읽기 | 0.2달러 | 0.2달러 | 0.01달러 |
| 캐시 쓰기 | 5달러 (5분 보관) | 2.5달러 | 0.125달러 |
9월 23일 공식 가격표 기준34. 원화는 같은 날 네이버 금융 환율 1,351.40원으로 계산했어요17.
입력도 출력도 솔이 딱 절반이에요. 오퍼스 5.5도 오퍼스 5보다 20% 내렸지만 솔이 더 크게 내렸어요12.
그런데 한 줄만 숫자가 똑같아요. 👀
캐시 읽기예요. 둘 다 100만 토큰당 0.2달러예요34. 앤트로픽이 이번에 캐시 읽기만 60%나 내린 덕분이에요. 에이전트와 코딩 작업 비용은 대부분 캐시 읽기에서 나온다는 게 앤트로픽 설명이에요1.
그러니까 짧은 일을 새로 시키면 솔이 절반, 같은 자료를 계속 다시 읽히는 긴 일에서는 차이가 좁아져요. 여기에 앤트로픽은 오퍼스 5.5가 같은 일을 더 적은 토큰으로 끝낸다고 했어요1. 가격표만 보고 판정하면 안 되는 이유예요.
조건도 몇 가지 붙어요. 솔은 한 번에 보내는 입력이 27만2000 토큰을 넘으면 그 요청 전체에 입력 2배, 출력 1.5배 요금이 붙어요5. 답을 빨리 받는 Fast 모드는 오퍼스 5.5가 입력 8달러, 출력 40달러이고 솔은 평소의 2배예요15.
계체량 결과: 서류상으로는 솔이 가벼워요. 진짜 무게는 실전 청구서로 재요.
1판. 사내 공지 한 장 쓰기 📝
제일 흔한 일부터 시켰어요. 규칙을 잔뜩 붙여서요.
숙제는 이 가격 소식을 팀에 알리는 사내 메신저 공지예요. 발표 사실 다섯 줄을 주고 규칙 여섯 개를 붙였어요.
공백 포함 600자 이내 / 긴 줄표 금지 / AI가 즐겨 쓰는 관용 표현 하나 금지 / 이모지 금지 / 준 사실에 없는 숫자 금지 / 마지막 줄은 팀원에게 묻는 질문
AI가 쓴 한국어 글에서 자주 보이는 버릇을 일부러 막은 규칙이에요. 채점은 사람 눈이 아니라 프로그램으로 했어요. 글자 수를 세고 금지 표현이나 없던 숫자가 끼었는지 찾았어요.
누가 먼저 들어왔을까? · 공지 한 장, 세 번 평균
결과부터 볼게요.
| 세 번 결과 | 오퍼스 5.5 | 솔 | 루나 |
|---|---|---|---|
| 규칙 위반 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 0 / 0 |
| 글자 수 | 445~501자 | 373~397자 | 365~370자 |
셋 다 만점이에요. 긴 줄표도, 금지한 관용 표현도, 없는 숫자도 하나도 없었어요.
모양은 좀 달랐어요. 오퍼스는 모델별로 번호를 매겨 목록으로 정리하고 "우리 팀 참고"라는 칸을 따로 만들었어요. 마지막 질문도 "솔과 루나도 함께 비교해 볼지"까지 물었어요. 솔은 세 문단으로 깔끔하게 끝냈고, 루나는 전부 한 문단에 몰아 썼어요.

읽기 편한 건 오퍼스 쪽이라는 분도 있을 거예요. 하지만 채점표는 무승부예요. 그럼 규칙대로 청구서를 봐야죠.
채점표는 무승부. 그런데 청구서가 5배 차이 났어요. 💸
| 세 번 평균 | 오퍼스 5.5 | 솔 | 루나 |
|---|---|---|---|
| AI가 쓴 토큰 | 1,263개 | 480개 | 404개 |
| 공지 1장 비용 | 약 37원 | 약 7.4원 | 약 0.3원 |
| 1,000장이면 | 약 3만7055원 | 약 7,402원 | 약 318원 |
글자 수는 오퍼스가 20~30% 많을 뿐인데 쓴 토큰은 2.6배예요. 오퍼스는 공지를 쓰기 전에 생각하는 단계를 거치는데, 그 생각에도 출력 토큰 요금이 붙거든요. 오퍼스 5.5는 이 단계를 끌 수 없어요1.
솔+1 🎉
1판 최종 결과

규칙 만점
목록과 참고 칸까지 정리했지만 공지 한 장에 약 37원이 들었어요.

규칙 만점
세 문단으로 끝냈고 한 장에 약 7.4원이 들었어요.
1판 승자: 솔. 채점표는 무승부, 비용은 5분의 1이에요.
2판. 숫자 계산하기 🧮
이번엔 틀리면 바로 티가 나는 숙제예요. 정답이 하나뿐이거든요.
1경기. 어제 블로그 방문 기록 풀기
재료는 이 블로그의 실제 기록이에요. 9월 22일, 글 하나에 방문자가 몰려 하루 최고 기록을 찍은 날이에요. 그 글의 시간대별 페이지뷰 24줄과 기기별 사용자·참여 시간 표를 건네고 여섯 문제를 냈어요. 가장 붐빈 시간, 하루 합계, 아침 7~9시 합계, 데스크톱과 모바일 각각의 1인당 참여 시간, 끝까지 스크롤한 비율을 물었어요.
세 선수 모두 여섯 문제 전부 맞혔어요. 세 번 다요. ✅
틀린 선수가 없으니 이번에도 청구서로 가려요. 한 번 푸는 데 오퍼스 약 13.2원, 솔 약 4.4원, 루나 약 0.25원이 들었어요. 오퍼스가 솔의 3배예요.
솔+1 🎉
2경기. 요금 함정 문제
두 번째는 일부러 함정을 팠어요. 요금 규칙을 주고 요청 여섯 건의 비용을 원화로 계산하게 했어요. 규칙은 솔의 실제 요금 방식을 그대로 빌려 왔어요5.
한 요청의 입력 합계가 272,000 토큰을 "넘으면" 입력은 2배, 출력은 1.5배. 배치로 보낸 요청은 절반.
함정은 세 개예요. 입력 합계가 딱 272,000인 요청(넘지 않았으니 할증 없음), 272,001인 요청(1토큰 넘어서 할증), 모든 값이 0인 요청이에요. 거기에 원 단위 반올림까지 시켰어요.
이번엔 게스트가 한 번 넘어졌어요. 🫢
| 세 번 결과 | 오퍼스 5.5 | 솔 | 루나 |
|---|---|---|---|
| 7칸 중 정답 | 7 / 7 / 7 | 7 / 7 / 7 | 2 / 7 / 7 |
| 한 번 비용 | 약 14.7원 | 약 4.0원 | 약 0.35원 |
오퍼스와 솔은 경계에 판 함정을 한 번도 안 밟았어요. 루나는 첫 번째 시도에서 반올림을 안 하고 248.4원처럼 소수점을 그대로 적었어요. 계산은 맞았지만 시킨 형식을 어겨 다섯 칸이 오답이 됐어요. 나머지 두 번은 만점이었어요.
주전 두 선수는 또 무승부예요. 청구서는 오퍼스가 솔의 3.7배고요.
솔+1 🎉
2판 최종 결과

2경기 모두 만점
함정은 한 번도 안 밟았지만 매번 13~15원이 들었어요.

2경기 모두 만점
똑같이 다 맞혔는데 비용은 한 번에 4원대였어요.
2판 승자: 솔. 게스트 루나는 반올림을 한 번 빠뜨렸어요.
3판. 그림 한 장 그리기 🎨
마지막 판은 결과물이 눈에 보이는 숙제예요. 여기서는 정답이 하나가 아니에요.
경기 전에 들려온 소식이 하나 있어요. AI 모델마다 "자전거 타는 펠리컨" 그림을 시켜 보는 걸로 유명한 개발자 사이먼 윌리슨이 오퍼스 5.5를 최고 강도(max)로 돌렸더니 그림을 끝내 내놓지 못했대요. 다리 길이와 페달 위치를 계속 따지다가 출력 한도 12만8000 토큰을 생각하는 데 다 써 버렸다고요. 두 번 시켜 두 번 다 그랬고, 한 번에 2.56달러, 시간은 20분 가까이 들었대요10.
그래서 이번 판도 앞 판들처럼 기본 강도로 돌렸어요.
숙제는 이 글의 섬네일 후보예요.
주황색 블록 로봇과 흑백 블록 로봇이 "가격표"를 사이에 두고 줄다리기를 한다. 가운데 바닥에 동전이 쌓여 있다. 글자는 넣지 말 것.
누가 먼저 들어왔을까? · 그림 한 장, 세 번 평균
아홉 장을 한 번에 펼쳐 볼게요. 위에서부터 한 줄씩 오퍼스, 솔, 루나이고 왼쪽부터 첫 번째, 두 번째, 세 번째 시도예요.

한 줄만 줄다리기를 하고 있어요. 💪
기본 조건은 아홉 장 모두 지켰어요. 주황 로봇과 흑백 로봇, 가격표, 동전 더미가 다 있고 글자는 한 장도 없어요.
차이는 "줄다리기"에서 났어요. 오퍼스의 세 장은 전부 밧줄을 두 손으로 잡고 몸을 뒤로 젖혀 당기고 있어요. 땀방울과 찌푸린 눈썹까지 그렸어요. 솔의 세 장은 두 로봇이 가격표를 가운데 두고 마주 서 있어요. 가격표를 같이 들고 있을 뿐 당기지는 않아요. 루나는 세 장 중 두 장에 줄이 있지만 역시 서 있기만 해요.
| 세 번 결과 | 오퍼스 5.5 | 솔 | 루나 |
|---|---|---|---|
| 당기는 자세까지 그림 | 3 / 3 | 0 / 3 | 0 / 3 |
| 한 장 비용 | 약 207원 | 약 62원 | 약 3원 |
이번엔 결과물이 달라요. 채점 규칙에선 돈보다 결과물이 먼저예요. 오퍼스는 솔보다 돈을 3.3배 썼지만 시킨 장면을 그린 건 오퍼스뿐이에요.
솔
+1 🎉3판 최종 결과

줄다리기 3 / 3
세 장 모두 밧줄을 잡고 몸을 젖혀 당겼어요. 한 장 약 207원, 69초.

줄다리기 0 / 3
가격표를 가운데 두고 마주 섰어요. 한 장 약 62원, 46초.
3판 승자: 오퍼스. 시킨 장면을 그린 건 오퍼스뿐이에요.
세 판 최종 결과 🏆

1승 3패
결과물로 가른 판은 이겼고 무승부 뒤 돈으로 가른 세 경기는 졌어요.

3승 1패
세 경기 모두 같은 점수에서 비용으로 이겼어요.
최종 승자: 솔. 게스트 루나는 형식 실수 한 번을 빼면 모두 만점이었고 비용은 솔의 4~9% 수준이었어요.
경기 수로는 솔이 3대 1로 이겼어요. 판마다 무엇으로 갈렸는지 다시 적어 둘게요.
- 1판 공지: 셋 다 규칙 만점. 오퍼스가 솔의 5배를 써서 솔 승
- 2판 1경기 방문 기록 계산: 셋 다 여섯 문제 만점. 오퍼스가 솔의 3배를 써서 솔 승
- 2판 2경기 요금 함정: 오퍼스와 솔 만점, 루나 한 번 형식 실수. 오퍼스가 솔의 3.7배를 써서 솔 승
- 3판 그림: 당기는 자세를 그린 건 오퍼스 3장뿐. 오퍼스 승
솔의 3승은 전부 채점표 무승부 뒤 돈으로 가른 승리예요. 결과물로 가른 판은 하나였고 거기서는 오퍼스가 이겼어요.
세 모델 모두 API 기본 설정(추론 강도 medium)으로 과제마다 세 번씩 돌렸어요. 시간은 요청을 보내고 답을 받을 때까지 잰 값이고 비용은 모델이 보고한 토큰 수에 9월 23일 공식 가격표를 곱했어요.
왜 이렇게 갈렸을까? 생각 모드와 한국어 토큰
가격표는 2배 차이인데 청구서는 3~5배 차이가 났어요. 이유가 두 개 보였어요.첫째는 생각 모드예요. 공지 한 장에 오퍼스가 쓴 출력 토큰은 1,263개로 솔의 2.6배였어요. 글자 수 차이는 그보다 훨씬 작았으니 나머지는 쓰기 전에 생각한 몫이에요. 오퍼스 5.5는 생각을 끄는 선택지가 없어요1. 솔은 추론 강도를 "none"까지 내릴 수 있어요5.
둘째는 한국어예요. 똑같은 한국어 지시문을 보냈는데 입력 토큰이 오퍼스 쪽에서 1.4~1.6배로 세어졌어요. 공지 숙제는 오퍼스 540개, 솔 337개였어요. 두 회사가 같은 글을 토큰으로 세는 방식이 달라서 그래요. 목록 가격이 같았더라도 한국어로 일을 시키면 오퍼스 쪽 입력 비용이 그만큼 더 나와요.
입력 토큰에는 요청을 포장하는 몇 토큰이 섞여 있어요. 그걸 빼도 비율은 거의 같아요.
그렇다고 앤트로픽의 "40% 덜 든다"가 틀린 건 아니에요. 그 숫자는 오퍼스 5와 비교한 것이고 코드 수십만 줄을 옮기거나 몇 시간씩 혼자 돌리는 긴 작업에서 잰 거예요1. 이런 긴 일은 같은 자료를 계속 다시 읽어서 캐시 읽기 비중이 커지는데 캐시 읽기는 두 모델 모두 0.2달러로 같아요. 이번 경기는 짧은 한국어 일만 쟀고 긴 에이전트 작업은 재지 않았어요.
그래서 나는 뭘 써야 해요?
📝 짧은 글과 계산을 많이 돌린다면 솔
공지, 메일, 요약, 표 계산처럼 정답이 분명한 짧은 일은 이번 경기에서 결과물 차이가 없었어요. 1,000건을 돌리면 공지 기준 오퍼스 약 3만7000원, 솔 약 7,400원이에요. 형식 검사를 붙일 수 있다면 루나로 318원까지 내려가요.
🎨 눈에 보이는 결과물이 중요하다면 오퍼스 5.5
시킨 장면을 끝까지 그대로 그린 건 오퍼스뿐이었어요. 앤트로픽이 내세운 긴 코드 작업도 이쪽이에요1. 다만 최고 강도(max)는 사이먼 윌리슨의 사례처럼 생각만 하다 끝날 수 있으니 기본 강도부터 쓰는 게 안전해요10.
구독으로 쓴다면 쓸 수 있는 곳이 달라요.
| 요금제 | 오퍼스 5.5 | GPT-6 솔·루나 |
|---|---|---|
| 무료 | 못 써요 | Free·Go(월 1만3000원)는 데스크톱 앱에서 루나만 |
| 개인 유료 | Pro 월 22달러부터(부가세 포함, 연간 결제 시 월 18달러) | Plus 월 2만9000원부터, Work와 코덱스에서 |
| 일반 채팅창 | 씀 | 아직 없음 |
9월 23일 각 사 요금제 페이지와 발표문 기준2789.
챗GPT 채팅창에서 솔을 찾으면 안 보여요. 솔과 루나는 Work와 코덱스에만 들어갔고 채팅창 모델과는 따로예요29. 클로드는 이번 출시에 맞춰 Pro·Max·Team 요금제의 5시간 사용 한도를 늘리고 한도 초기화를 한 번 저장해 뒀다가 원할 때 쓰게 했어요1.
자주 묻는 것
클로드 오퍼스 5.5 API 가격은 얼마인가요
100만 토큰당 입력 4달러, 출력 20달러예요. 오퍼스 5의 5달러, 25달러보다 20% 낮아요. 캐시 읽기는 0.2달러로 60% 낮아졌고 급하지 않은 일을 배치로 보내면 입력 2달러, 출력 10달러예요13.
GPT-6 솔과 루나는 뭐가 다른가요
솔은 한 단계 아래 주력 모델이고 루나는 가장 싸고 빠른 모델이에요. API 가격은 솔이 입력 2달러, 출력 10달러, 루나가 입력 0.1달러, 출력 0.5달러로 20배 차이예요. 둘 다 입력 105만 토큰까지 받고 한 번에 12만8000 토큰까지 답해요4516.
GPT-6 솔을 챗GPT 채팅창에서 쓸 수 있나요
9월 23일 기준으로는 못 써요. Plus 이상 요금제의 Work와 코덱스에서만 쓸 수 있고 오픈AI는 채팅창에는 아직 없다고 밝혔어요. 무료와 Go 요금제는 데스크톱 앱에서 루나를 쓸 수 있어요29.
오퍼스 5.5를 무료로 쓸 수 있나요
클로드 무료 요금제에는 오퍼스가 없어요. Pro 이상 개인 요금제부터 쓸 수 있어요7.
확인하지 못한 것
- 이번 경기는 짧은 한국어 일 네 가지만 쟀어요. 몇 시간씩 도는 코딩이나 에이전트 작업에서 두 모델의 비용이 어떻게 달라지는지는 재지 않았어요
- 추론 강도는 두 모델 모두 기본값(medium)만 썼어요. 강도를 바꾸면 결과와 비용이 달라질 수 있어요
- 과제마다 세 번씩 돌렸어요. 표본이 작아서 루나의 실수가 얼마나 자주 나오는지는 말할 수 없어요
- 3판의 "당기는 자세"는 그림을 눈으로 보고 판정했어요. 프로그램으로 잰 1·2판과 달리 사람의 판단이 들어갔어요