← 전체 리포트 · md 가이드 · Unity 가이드

모델 벤치마크 · Claude / Codex

v1.0 · 2026-10-06 갱신

모든 수치는 개발사 공식 발표값입니다. 공식 수치가 없는 칸은 —로 둡니다. 매일 수집한 글에 공식 발표(새 모델, 점수, 가격, 종료 일정)가 있으면 갱신하고 이력을 남깁니다.

벤치마크 점수는 노력 수준·도구·버전 조건에 따라 달라집니다. 회사가 다르면 같은 이름의 벤치마크도 조건이 달라 직접 비교하기 어렵습니다. "어떤 작업에 어떤 모델"은 개발사 권장 용도를 바탕으로 했습니다.

Claude Code: /model opus 처럼 바꾸거나, 서브에이전트 파일의 model: 값(haiku·sonnet·opus·fable)으로 지정

어떤 작업에 어떤 모델

작업추천이유근거
코드 탐색, 로그·문서 요약, 대량 단순 작업, 서브에이전트Haiku 4.5가장 빠르고 저렴($1/$5). 공식 소개: 상위 모델이 계획하고 여러 Haiku가 하위 작업을 병렬 수행공식
범위가 정해진 일상 작업: 버그 수정, 단일 기능 구현, 문서 작성Sonnet 5.5공식 권장 용도. 에이전트 코딩 지표가 Opus 5.5와 비슷하거나 높고(Terminal-Bench 4.0 70.6%) 가격은 절반공식
판단이 필요한 복잡·장기 작업: 설계, 리드 세션, 계획·총정리, 최종 리뷰Opus 5.5공식: 신중한 판단이 필요한 복잡한 작업용이며, 열린 문제에서는 Sonnet 5.5보다 확실히 강함공식
가장 길고 어려운 연구·에이전트 작업Fable 5.1공식 용도는 장기 에이전트·연구. 단, 위 코딩 지표는 Opus 5.5가 더 높고 가격은 2.5배라 코딩 리드는 Opus 5.5가 비용 대비 유리 (해석)공식+해석

모델

모델지정 이름가격 (입력/출력)출시용도출처
Claude Fable 5.1fable$10 / $502026-09최상위 등급. 장기 에이전트·연구용공식
Claude Opus 5.5opus$4 / $202026-09-22복잡한 판단이 필요한 작업용공식
Claude Sonnet 5.5sonnet$2 / $102026-09-28범위가 정해진 일상 작업·대량 작업용공식
Claude Haiku 4.5haiku$1 / $52025-10-15빠르고 저렴. 서브에이전트 병렬 작업용공식

가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.

공식 벤치마크

벤치마크Fable 5.1Opus 5.5Sonnet 5.5Haiku 4.5비고 · 출처
Terminal-Bench 4.0
에이전트 코딩
55.8%66.4%70.6%—Opus 5.5는 xhigh 노력 기준
출처
FrontierCode 1.1 (Main)
에이전트 코딩
50.3%54.4%52.1% (xhigh) · 46.2% (max)—범위 밖 수정에 감점. Sonnet 5.5는 max보다 xhigh가 높음
출처
CursorBench 4.0
에이전트 코딩
51.8%57.8%55.5%—
출처
GDPval-AA v2.1
지식 업무 (Elo)
173518461844—Artificial Analysis 측정
출처
OSWorld 2.1 (partial)
컴퓨터 사용
80.7%81.8%80.1%—
출처
Humanity's Last Exam (도구 사용)
추론
65.6%67.7%64.5%—Fable 5.1 자체 발표값은 65.0%(조건 차이)
출처
AutomationBench
업무 자동화
31.4%40.0%——
출처
SWE-bench Verified
코딩 (구세대 지표)
———73.3%Haiku 4.5 발표(2025-10) 당시 지표라 위 모델과 직접 비교 불가
출처

Codex: /model로 바꾸거나 config.toml에 model = "gpt-6.1-sol" 처럼 지정

어떤 작업에 어떤 모델

작업추천이유근거
요약, 추출, 범위가 좁은 코딩 등 대량·반복 작업GPT-6 Luna공식 권장 용도. 가장 저렴($0.10/$0.50)공식
일상 개발과 오래 돌리는 작업의 기본값GPT-6.1 Sol공식: 반복·장기 실행 작업을 Astra보다 낮은 비용으로. 일부 지표는 Astra에 근접공식
복잡한 설계·판단, 여러 앱을 오가는 작업, 컴퓨터 사용GPT-6 Astra공식: 고급 추론·컴퓨터 사용·판단력을 결합한 복잡한 작업용. 가격은 Sol의 5배공식

모델

모델지정 이름가격 (입력/출력)출시용도출처
GPT-6 Astragpt-6-astra$10 / $502026-09-03복잡한 작업·판단·컴퓨터 사용공식
GPT-6.1 Solgpt-6.1-sol$2 / $102026-09반복·장기 실행 작업 (Astra보다 저렴)공식
GPT-6 Lunagpt-6-luna$0.10 / $0.502026-09요약·추출·범위 좁은 코딩 등 대량 작업공식

가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.

공식 벤치마크

벤치마크GPT-6 AstraGPT-6.1 SolGPT-6 Luna비고 · 출처
Terminal-Bench 4.0
에이전트 코딩
57.9%——Sol·Luna는 공식 수치 없음
출처
DeepSWE v1.1
코딩
74.1%GPT-6 Sol(68.8%)보다 +6.4%p66.6% (max)6.1 Sol은 공식 발표가 상대 비교로만 제시
출처
FrontierCode 1.1 (Main)
에이전트 코딩
53.3%——Astra는 코드 품질·저장소 관례를 지시한 개발자 메시지 사용
출처
OSWorld 2.0 (offline)
컴퓨터 사용
72.6%Astra와 2.1%p 이내—
출처
AutomationBench
업무 자동화
41.4%Opus 5.5보다 +2.2%p—
출처
Terminal-Bench Science 0.1
과학 연구
64.6%GPT-6 Sol의 약 2배 · 과제당 $5.47 (Astra $23.80)—
출처

두 회사가 같은 이름의 벤치마크를 발표했지만 노력 수준·도구·버전 조건이 달라 같은 줄의 숫자를 그대로 비교하면 안 됩니다. 방향을 보는 참고용입니다.

같은 이름의 벤치마크 (높은 순)

벤치마크발표값출처
Terminal-Bench 4.0Sonnet 5.5 70.6% · Opus 5.5 66.4% (xhigh) · GPT-6 Astra 57.9% · Fable 5.1 55.8%Anthropic·OpenAI 발표
FrontierCode 1.1 (Main)Opus 5.5 54.4% · GPT-6 Astra 53.3% · Sonnet 5.5 52.1% (xhigh) · Fable 5.1 50.3%Anthropic·OpenAI 발표
AutomationBenchGPT-6 Astra 41.4% · Opus 5.5 40.0% · Fable 5.1 31.4%Anthropic·OpenAI 발표

역할별 짝 (리드·하위 세션 구성 예, 해석)

역할ClaudeCodex
리드 (계획·총정리·최종 리뷰)Opus 5.5GPT-6 Astra
구현 세션 (지시서대로 수행)Sonnet 5.5GPT-6.1 Sol
탐색·요약 서브에이전트Haiku 4.5GPT-6 Luna
버전날짜구분변경이유근거
v1.02026-10-06초기 작성: Claude 4종, Codex 3종 (공식 발표값)