모델 벤치마크 · Claude / Codex
v1.0 · 2026-10-06 갱신
모든 수치는 개발사 공식 발표값입니다. 공식 수치가 없는 칸은 —로 둡니다. 매일 수집한 글에 공식 발표(새 모델, 점수, 가격, 종료 일정)가 있으면 갱신하고 이력을 남깁니다.
벤치마크 점수는 노력 수준·도구·버전 조건에 따라 달라집니다. 회사가 다르면 같은 이름의 벤치마크도 조건이 달라 직접 비교하기 어렵습니다. "어떤 작업에 어떤 모델"은 개발사 권장 용도를 바탕으로 했습니다.
Claude Code: /model opus 처럼 바꾸거나, 서브에이전트 파일의 model: 값(haiku·sonnet·opus·fable)으로 지정
어떤 작업에 어떤 모델
| 작업 | 추천 | 이유 | 근거 |
|---|---|---|---|
| 코드 탐색, 로그·문서 요약, 대량 단순 작업, 서브에이전트 | Haiku 4.5 | 가장 빠르고 저렴($1/$5). 공식 소개: 상위 모델이 계획하고 여러 Haiku가 하위 작업을 병렬 수행 | 공식 |
| 범위가 정해진 일상 작업: 버그 수정, 단일 기능 구현, 문서 작성 | Sonnet 5.5 | 공식 권장 용도. 에이전트 코딩 지표가 Opus 5.5와 비슷하거나 높고(Terminal-Bench 4.0 70.6%) 가격은 절반 | 공식 |
| 판단이 필요한 복잡·장기 작업: 설계, 리드 세션, 계획·총정리, 최종 리뷰 | Opus 5.5 | 공식: 신중한 판단이 필요한 복잡한 작업용이며, 열린 문제에서는 Sonnet 5.5보다 확실히 강함 | 공식 |
| 가장 길고 어려운 연구·에이전트 작업 | Fable 5.1 | 공식 용도는 장기 에이전트·연구. 단, 위 코딩 지표는 Opus 5.5가 더 높고 가격은 2.5배라 코딩 리드는 Opus 5.5가 비용 대비 유리 (해석) | 공식+해석 |
모델
| 모델 | 지정 이름 | 가격 (입력/출력) | 출시 | 용도 | 출처 |
|---|---|---|---|---|---|
| Claude Fable 5.1 | fable | $10 / $50 | 2026-09 | 최상위 등급. 장기 에이전트·연구용 | 공식 |
| Claude Opus 5.5 | opus | $4 / $20 | 2026-09-22 | 복잡한 판단이 필요한 작업용 | 공식 |
| Claude Sonnet 5.5 | sonnet | $2 / $10 | 2026-09-28 | 범위가 정해진 일상 작업·대량 작업용 | 공식 |
| Claude Haiku 4.5 | haiku | $1 / $5 | 2025-10-15 | 빠르고 저렴. 서브에이전트 병렬 작업용 | 공식 |
가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.
공식 벤치마크
| 벤치마크 | Fable 5.1 | Opus 5.5 | Sonnet 5.5 | Haiku 4.5 | 비고 · 출처 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 에이전트 코딩 | 55.8% | 66.4% | 70.6% | — | Opus 5.5는 xhigh 노력 기준 출처 |
| FrontierCode 1.1 (Main) 에이전트 코딩 | 50.3% | 54.4% | 52.1% (xhigh) · 46.2% (max) | — | 범위 밖 수정에 감점. Sonnet 5.5는 max보다 xhigh가 높음 출처 |
| CursorBench 4.0 에이전트 코딩 | 51.8% | 57.8% | 55.5% | — | 출처 |
| GDPval-AA v2.1 지식 업무 (Elo) | 1735 | 1846 | 1844 | — | Artificial Analysis 측정 출처 |
| OSWorld 2.1 (partial) 컴퓨터 사용 | 80.7% | 81.8% | 80.1% | — | 출처 |
| Humanity's Last Exam (도구 사용) 추론 | 65.6% | 67.7% | 64.5% | — | Fable 5.1 자체 발표값은 65.0%(조건 차이) 출처 |
| AutomationBench 업무 자동화 | 31.4% | 40.0% | — | — | 출처 |
| SWE-bench Verified 코딩 (구세대 지표) | — | — | — | 73.3% | Haiku 4.5 발표(2025-10) 당시 지표라 위 모델과 직접 비교 불가 출처 |
Codex: /model로 바꾸거나 config.toml에 model = "gpt-6.1-sol" 처럼 지정
어떤 작업에 어떤 모델
| 작업 | 추천 | 이유 | 근거 |
|---|---|---|---|
| 요약, 추출, 범위가 좁은 코딩 등 대량·반복 작업 | GPT-6 Luna | 공식 권장 용도. 가장 저렴($0.10/$0.50) | 공식 |
| 일상 개발과 오래 돌리는 작업의 기본값 | GPT-6.1 Sol | 공식: 반복·장기 실행 작업을 Astra보다 낮은 비용으로. 일부 지표는 Astra에 근접 | 공식 |
| 복잡한 설계·판단, 여러 앱을 오가는 작업, 컴퓨터 사용 | GPT-6 Astra | 공식: 고급 추론·컴퓨터 사용·판단력을 결합한 복잡한 작업용. 가격은 Sol의 5배 | 공식 |
모델
| 모델 | 지정 이름 | 가격 (입력/출력) | 출시 | 용도 | 출처 |
|---|---|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | $10 / $50 | 2026-09-03 | 복잡한 작업·판단·컴퓨터 사용 | 공식 |
| GPT-6.1 Sol | gpt-6.1-sol | $2 / $10 | 2026-09 | 반복·장기 실행 작업 (Astra보다 저렴) | 공식 |
| GPT-6 Luna | gpt-6-luna | $0.10 / $0.50 | 2026-09 | 요약·추출·범위 좁은 코딩 등 대량 작업 | 공식 |
가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.
공식 벤치마크
| 벤치마크 | GPT-6 Astra | GPT-6.1 Sol | GPT-6 Luna | 비고 · 출처 |
|---|---|---|---|---|
| Terminal-Bench 4.0 에이전트 코딩 | 57.9% | — | — | Sol·Luna는 공식 수치 없음 출처 |
| DeepSWE v1.1 코딩 | 74.1% | GPT-6 Sol(68.8%)보다 +6.4%p | 66.6% (max) | 6.1 Sol은 공식 발표가 상대 비교로만 제시 출처 |
| FrontierCode 1.1 (Main) 에이전트 코딩 | 53.3% | — | — | Astra는 코드 품질·저장소 관례를 지시한 개발자 메시지 사용 출처 |
| OSWorld 2.0 (offline) 컴퓨터 사용 | 72.6% | Astra와 2.1%p 이내 | — | 출처 |
| AutomationBench 업무 자동화 | 41.4% | Opus 5.5보다 +2.2%p | — | 출처 |
| Terminal-Bench Science 0.1 과학 연구 | 64.6% | GPT-6 Sol의 약 2배 · 과제당 $5.47 (Astra $23.80) | — | 출처 |
- GPT-5.5는 2026-10-14에 ChatGPT·Codex에서 종료 예정 (공식 문서). GPT-5.4·5.4-mini, GPT-5.3-Codex-Spark는 종료됨
두 회사가 같은 이름의 벤치마크를 발표했지만 노력 수준·도구·버전 조건이 달라 같은 줄의 숫자를 그대로 비교하면 안 됩니다. 방향을 보는 참고용입니다.
같은 이름의 벤치마크 (높은 순)
| 벤치마크 | 발표값 | 출처 |
|---|---|---|
| Terminal-Bench 4.0 | Sonnet 5.5 70.6% · Opus 5.5 66.4% (xhigh) · GPT-6 Astra 57.9% · Fable 5.1 55.8% | Anthropic·OpenAI 발표 |
| FrontierCode 1.1 (Main) | Opus 5.5 54.4% · GPT-6 Astra 53.3% · Sonnet 5.5 52.1% (xhigh) · Fable 5.1 50.3% | Anthropic·OpenAI 발표 |
| AutomationBench | GPT-6 Astra 41.4% · Opus 5.5 40.0% · Fable 5.1 31.4% | Anthropic·OpenAI 발표 |
역할별 짝 (리드·하위 세션 구성 예, 해석)
| 역할 | Claude | Codex |
|---|---|---|
| 리드 (계획·총정리·최종 리뷰) | Opus 5.5 | GPT-6 Astra |
| 구현 세션 (지시서대로 수행) | Sonnet 5.5 | GPT-6.1 Sol |
| 탐색·요약 서브에이전트 | Haiku 4.5 | GPT-6 Luna |
| 버전 | 날짜 | 구분 | 변경 | 이유 | 근거 |
|---|---|---|---|---|---|
| v1.0 | 2026-10-06 | 초기 작성: Claude 4종, Codex 3종 (공식 발표값) | |||