모델 벤치마크 · Claude / Codex
v1.0 · 2026-10-06 갱신
"한눈에" 탭부터 보세요. 같은 돈으로 얼마나 쓰는지, 과제 하나에 얼마·몇 분이 드는지, 어떤 작업에 어떤 모델을 쓰면 되는지를 모았습니다. 점수는 개발사 공식 발표값만 쓰고, 공식 수치가 없는 칸은 —로 둡니다. 요금제 비교의 보도·외부 분석은 따로 표시했습니다. 공식 발표(새 모델, 점수, 가격, 요금제 한도)가 나오면 갱신하고 이력을 남깁니다.
벤치마크 점수는 노력 수준·도구·버전 조건에 따라 달라집니다. 회사가 다르면 같은 이름의 벤치마크도 조건이 달라 직접 비교하기 어렵습니다. "어떤 작업에 어떤 모델"은 개발사 권장 용도를 바탕으로 했습니다.
• 같은 구독료라면 Claude(Opus 5.5) 구독이 OpenAI(GPT-6.1 Sol) 구독보다 API 요금 환산으로 약 5배를 쓸 수 있다. 에이전트 작업 기준이며, 최상위 모델끼리(Fable 5.1 대 Astra)는 한도가 비슷하다. 외부 분석 출처
• OpenAI는 10월 30일부터 $200 요금제의 Codex·Work 사용량을 Plus의 20배에서 10배로 줄이고, 25배인 $500 요금제를 새로 냈다. Codex의 5시간 한도는 없어지고 주간 한도만 남는다. 보도 출처
• 과제 하나에 드는 API 비용은 GPT-6.1 Sol이 가장 싸다: Terminal-Bench Science 기준 $5.47, Opus 5.5 $23.21, Astra $23.80. 공식 출처
• 코딩 에이전트 지표는 Opus 5.5·Sonnet 5.5가 앞선다: Terminal-Bench 4.0에서 Sonnet 5.5 70.6%, Opus 5.5 66.4%, Astra 57.9%. 공식 출처
체감 비교
| 도구 | 모델 | 코딩 실력 | 비용 | 주 용도 | 근거 |
|---|---|---|---|---|---|
| Claude | Opus 5.5 | ★★★★★ | $$ | 리드·설계·최종 리뷰 | Terminal-Bench 4.0 66.4%, FrontierCode 54.4%(두 회사 발표 중 최고) · $4/$20 |
| Sonnet 5.5 | ★★★★☆ | $ | 일상 구현·버그 수정 | Terminal-Bench 4.0 70.6%, FrontierCode 52.1% · $2/$10. 열린 문제는 Opus가 강하다는 공식 설명 | |
| Fable 5.1 | ★★★★☆ | $$$$$ | 가장 어려운 장기 연구 | Terminal-Bench 4.0 55.8% · $10/$50 (코딩 지표는 Opus 5.5보다 낮음) | |
| Haiku 4.5 | ★★☆☆☆ | $ | 탐색·요약 서브에이전트 | 구세대(2025-10) · $1/$5 · 최신 코딩 지표 없음 | |
| Codex | GPT-6 Astra | ★★★★☆ | $$$$$ | 복잡한 판단·컴퓨터 사용 | Terminal-Bench 4.0 57.9%, DeepSWE 74.1% · $10/$50 · 과제당 약 40분(OSWorld) |
| GPT-6.1 Sol | ★★★★☆ | $ | 일상 개발 기본값 | DeepSWE에서 GPT-6 Sol보다 +6.4%p, 일부 지표 Astra 근접 · $2/$10 · 과제당 비용 최저 | |
| GPT-6 Luna | ★★★☆☆ | ¢ | 요약·추출·단순 코딩 | DeepSWE 66.6% · $0.10/$0.50 |
해석: 코딩 실력은 두 회사가 발표한 코딩 지표(Terminal-Bench 4.0, FrontierCode, DeepSWE)로, 비용은 API 가격(¢ 가장 쌈 ~ $$$$$ 가장 비쌈)으로 매긴 상대 등급입니다. 회사 간 측정 조건이 달라 한 칸 차이는 큰 의미가 없습니다.
리드·하위 세션 구성 예 (해석)
| 역할 | Claude | Codex |
|---|---|---|
| 리드 (계획·총정리·최종 리뷰) | Opus 5.5 | GPT-6 Astra |
| 구현 세션 (지시서대로 수행) | Sonnet 5.5 | GPT-6.1 Sol |
| 탐색·요약 서브에이전트 | Haiku 4.5 | GPT-6 Luna |
사용량은 각 회사 기본 요금제(Claude Pro, ChatGPT Plus) 대비 배수입니다. 같은 배수라도 회사가 다르면 실제로 쓸 수 있는 양은 다릅니다(위 "한눈에"의 약 5배 차이 참고).
Claude (Claude Code)
| 요금제 | 월 요금 | 사용량 | 비고 | 출처 |
|---|---|---|---|---|
| Pro | $20 (연 결제 시 $17) | 기준 1배 | Claude Code 포함. Opus·Sonnet·Haiku, Fable은 사용량 크레딧 | 출처 |
| Max 5x | $100 | Pro의 5배 | 모든 모델 | 출처 |
| Max 20x | $200 | Pro의 20배 | 모든 모델. 5시간 단위 한도 + 주간 한도 | 출처 |
ChatGPT · Codex
API 가격으로 계산한 값입니다. 구독 요금제에서는 이 비용만큼 사용량이 더 빨리 줄어드는 것으로 체감됩니다.
| 항목 | 모델별 값 | 비고 · 출처 |
|---|---|---|
| 과제당 API 비용 · Terminal-Bench Science | GPT-6.1 Sol $5.47 Opus 5.5 $23.21 GPT-6 Astra $23.80 | 최대 노력 기준 출처 |
| 과제당 API 비용 · AutomationBench | GPT-6 Sol $0.27 GPT-6 Astra Sol의 3.9배 Fable 5.1 Sol의 8.9배 이상 Opus 5 Sol의 11.1배 | OpenAI 발표. Opus 5.5가 아닌 Opus 5 수치 출처 |
| 과제당 비용 · Artificial Analysis 지수 측정 | GPT-6 Astra $4.72 Fable 5.1 $9.18 | 보도 기준 출처 |
| 과제당 시간 · OSWorld 2.0 (컴퓨터 사용) | GPT-6 Astra 약 40분 (72.6%) GPT-5.6 Sol 약 75분 (65.7%) | 출처 |
Claude Code: /model opus 처럼 바꾸거나, 서브에이전트 파일의 model: 값(haiku·sonnet·opus·fable)으로 지정
어떤 작업에 어떤 모델
| 작업 | 추천 | 이유 | 근거 |
|---|---|---|---|
| 코드 탐색, 로그·문서 요약, 대량 단순 작업, 서브에이전트 | Haiku 4.5 | 가장 빠르고 저렴($1/$5). 공식 소개: 상위 모델이 계획하고 여러 Haiku가 하위 작업을 병렬 수행 | 공식 |
| 범위가 정해진 일상 작업: 버그 수정, 단일 기능 구현, 문서 작성 | Sonnet 5.5 | 공식 권장 용도. 에이전트 코딩 지표가 Opus 5.5와 비슷하거나 높고(Terminal-Bench 4.0 70.6%) 가격은 절반 | 공식 |
| 판단이 필요한 복잡·장기 작업: 설계, 리드 세션, 계획·총정리, 최종 리뷰 | Opus 5.5 | 공식: 신중한 판단이 필요한 복잡한 작업용이며, 열린 문제에서는 Sonnet 5.5보다 확실히 강함 | 공식 |
| 가장 길고 어려운 연구·에이전트 작업 | Fable 5.1 | 공식 용도는 장기 에이전트·연구. 단, 위 코딩 지표는 Opus 5.5가 더 높고 가격은 2.5배라 코딩 리드는 Opus 5.5가 비용 대비 유리 (해석) | 공식+해석 |
모델
| 모델 | 지정 이름 | 가격 (입력/출력) | 출시 | 용도 | 출처 |
|---|---|---|---|---|---|
| Claude Fable 5.1 | fable | $10 / $50 | 2026-09 | 최상위 등급. 장기 에이전트·연구용 | 공식 |
| Claude Opus 5.5 | opus | $4 / $20 | 2026-09-22 | 복잡한 판단이 필요한 작업용 | 공식 |
| Claude Sonnet 5.5 | sonnet | $2 / $10 | 2026-09-28 | 범위가 정해진 일상 작업·대량 작업용 | 공식 |
| Claude Haiku 4.5 | haiku | $1 / $5 | 2025-10-15 | 빠르고 저렴. 서브에이전트 병렬 작업용 | 공식 |
가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.
공식 벤치마크
| 벤치마크 | Fable 5.1 | Opus 5.5 | Sonnet 5.5 | Haiku 4.5 | 비고 · 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 에이전트 코딩 | 55.8% | 66.4% | 70.6% | — | Opus 5.5는 xhigh 노력 기준 출처 |
| FrontierCode 1.1 (Main) 에이전트 코딩 | 50.3% | 54.4% | 52.1% (xhigh) · 46.2% (max) | — | 범위 밖 수정에 감점. Sonnet 5.5는 max보다 xhigh가 높음 출처 |
| CursorBench 4.0 에이전트 코딩 | 51.8% | 57.8% | 55.5% | — | 출처 |
| GDPval-AA v2.1 지식 업무 (Elo) | 1735 | 1846 | 1844 | — | Artificial Analysis 측정 출처 |
| OSWorld 2.1 (partial) 컴퓨터 사용 | 80.7% | 81.8% | 80.1% | — | 출처 |
| Humanity's Last Exam (도구 사용) 추론 | 65.6% | 67.7% | 64.5% | — | Fable 5.1 자체 발표값은 65.0%(조건 차이) 출처 |
| AutomationBench 업무 자동화 | 31.4% | 40.0% | — | — | 출처 |
| SWE-bench Verified 코딩 (구세대 지표) | — | — | — | 73.3% | Haiku 4.5 발표(2025-10) 당시 지표라 위 모델과 직접 비교 불가 출처 |
Codex: /model로 바꾸거나 config.toml에 model = "gpt-6.1-sol" 처럼 지정
어떤 작업에 어떤 모델
| 작업 | 추천 | 이유 | 근거 |
|---|---|---|---|
| 요약, 추출, 범위가 좁은 코딩 등 대량·반복 작업 | GPT-6 Luna | 공식 권장 용도. 가장 저렴($0.10/$0.50) | 공식 |
| 일상 개발과 오래 돌리는 작업의 기본값 | GPT-6.1 Sol | 공식: 반복·장기 실행 작업을 Astra보다 낮은 비용으로. 일부 지표는 Astra에 근접 | 공식 |
| 복잡한 설계·판단, 여러 앱을 오가는 작업, 컴퓨터 사용 | GPT-6 Astra | 공식: 고급 추론·컴퓨터 사용·판단력을 결합한 복잡한 작업용. 가격은 Sol의 5배 | 공식 |
모델
| 모델 | 지정 이름 | 가격 (입력/출력) | 출시 | 용도 | 출처 |
|---|---|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | $10 / $50 | 2026-09-03 | 복잡한 작업·판단·컴퓨터 사용 | 공식 |
| GPT-6.1 Sol | gpt-6.1-sol | $2 / $10 | 2026-09 | 반복·장기 실행 작업 (Astra보다 저렴) | 공식 |
| GPT-6 Luna | gpt-6-luna | $0.10 / $0.50 | 2026-09 | 요약·추출·범위 좁은 코딩 등 대량 작업 | 공식 |
가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.
공식 벤치마크
| 벤치마크 | GPT-6 Astra | GPT-6.1 Sol | GPT-6 Luna | 비고 · 출처 |
|---|---|---|---|---|
| Terminal-Bench 4.0 에이전트 코딩 | 57.9% | — | — | Sol·Luna는 공식 수치 없음 출처 |
| DeepSWE v1.1 코딩 | 74.1% | GPT-6 Sol(68.8%)보다 +6.4%p | 66.6% (max) | 6.1 Sol은 공식 발표가 상대 비교로만 제시 출처 |
| FrontierCode 1.1 (Main) 에이전트 코딩 | 53.3% | — | — | Astra는 코드 품질·저장소 관례를 지시한 개발자 메시지 사용 출처 |
| OSWorld 2.0 (offline) 컴퓨터 사용 | 72.6% | Astra와 2.1%p 이내 | — | 출처 |
| AutomationBench 업무 자동화 | 41.4% | Opus 5.5보다 +2.2%p | — | 출처 |
| Terminal-Bench Science 0.1 과학 연구 | 64.6% | GPT-6 Sol의 약 2배 · 과제당 $5.47 (Astra $23.80) | — | 출처 |
- GPT-5.5는 2026-10-14에 ChatGPT·Codex에서 종료 예정 (공식 문서). GPT-5.4·5.4-mini, GPT-5.3-Codex-Spark는 종료됨
두 회사가 같은 이름의 벤치마크를 발표했지만 노력 수준·도구·버전 조건이 달라 같은 줄의 숫자를 그대로 비교하면 안 됩니다. 방향을 보는 참고용입니다.
같은 이름의 벤치마크 (높은 순)
| 벤치마크 | 발표값 | 출처 |
|---|---|---|
| Terminal-Bench 4.0 | Sonnet 5.5 70.6% · Opus 5.5 66.4% (xhigh) · GPT-6 Astra 57.9% · Fable 5.1 55.8% | Anthropic·OpenAI 발표 |
| FrontierCode 1.1 (Main) | Opus 5.5 54.4% · GPT-6 Astra 53.3% · Sonnet 5.5 52.1% (xhigh) · Fable 5.1 50.3% | Anthropic·OpenAI 발표 |
| AutomationBench | GPT-6 Astra 41.4% · Opus 5.5 40.0% · Fable 5.1 31.4% | Anthropic·OpenAI 발표 |
역할별 짝 (리드·하위 세션 구성 예, 해석)
| 역할 | Claude | Codex |
|---|---|---|
| 리드 (계획·총정리·최종 리뷰) | Opus 5.5 | GPT-6 Astra |
| 구현 세션 (지시서대로 수행) | Sonnet 5.5 | GPT-6.1 Sol |
| 탐색·요약 서브에이전트 | Haiku 4.5 | GPT-6 Luna |
| 버전 | 날짜 | 구분 | 변경 | 이유 | 근거 |
|---|---|---|---|---|---|
| v1.0 | 2026-10-06 | 초기 작성: Claude 4종, Codex 3종 (공식 발표값) | |||