← 전체 리포트 · md 가이드 · Unity 가이드

모델 벤치마크 · Claude / Codex

v1.0 · 2026-10-06 갱신

"한눈에" 탭부터 보세요. 같은 돈으로 얼마나 쓰는지, 과제 하나에 얼마·몇 분이 드는지, 어떤 작업에 어떤 모델을 쓰면 되는지를 모았습니다. 점수는 개발사 공식 발표값만 쓰고, 공식 수치가 없는 칸은 —로 둡니다. 요금제 비교의 보도·외부 분석은 따로 표시했습니다. 공식 발표(새 모델, 점수, 가격, 요금제 한도)가 나오면 갱신하고 이력을 남깁니다.

벤치마크 점수는 노력 수준·도구·버전 조건에 따라 달라집니다. 회사가 다르면 같은 이름의 벤치마크도 조건이 달라 직접 비교하기 어렵습니다. "어떤 작업에 어떤 모델"은 개발사 권장 용도를 바탕으로 했습니다.

• 같은 구독료라면 Claude(Opus 5.5) 구독이 OpenAI(GPT-6.1 Sol) 구독보다 API 요금 환산으로 약 5배를 쓸 수 있다. 에이전트 작업 기준이며, 최상위 모델끼리(Fable 5.1 대 Astra)는 한도가 비슷하다. 외부 분석 출처

• OpenAI는 10월 30일부터 $200 요금제의 Codex·Work 사용량을 Plus의 20배에서 10배로 줄이고, 25배인 $500 요금제를 새로 냈다. Codex의 5시간 한도는 없어지고 주간 한도만 남는다. 보도 출처

• 과제 하나에 드는 API 비용은 GPT-6.1 Sol이 가장 싸다: Terminal-Bench Science 기준 $5.47, Opus 5.5 $23.21, Astra $23.80. 공식 출처

• 코딩 에이전트 지표는 Opus 5.5·Sonnet 5.5가 앞선다: Terminal-Bench 4.0에서 Sonnet 5.5 70.6%, Opus 5.5 66.4%, Astra 57.9%. 공식 출처

체감 비교

도구모델코딩 실력비용주 용도근거
ClaudeOpus 5.5★★★★★$$리드·설계·최종 리뷰Terminal-Bench 4.0 66.4%, FrontierCode 54.4%(두 회사 발표 중 최고) · $4/$20
Sonnet 5.5★★★★☆$일상 구현·버그 수정Terminal-Bench 4.0 70.6%, FrontierCode 52.1% · $2/$10. 열린 문제는 Opus가 강하다는 공식 설명
Fable 5.1★★★★☆$$$$$가장 어려운 장기 연구Terminal-Bench 4.0 55.8% · $10/$50 (코딩 지표는 Opus 5.5보다 낮음)
Haiku 4.5★★☆☆☆$탐색·요약 서브에이전트구세대(2025-10) · $1/$5 · 최신 코딩 지표 없음
CodexGPT-6 Astra★★★★☆$$$$$복잡한 판단·컴퓨터 사용Terminal-Bench 4.0 57.9%, DeepSWE 74.1% · $10/$50 · 과제당 약 40분(OSWorld)
GPT-6.1 Sol★★★★☆$일상 개발 기본값DeepSWE에서 GPT-6 Sol보다 +6.4%p, 일부 지표 Astra 근접 · $2/$10 · 과제당 비용 최저
GPT-6 Luna★★★☆☆¢요약·추출·단순 코딩DeepSWE 66.6% · $0.10/$0.50

해석: 코딩 실력은 두 회사가 발표한 코딩 지표(Terminal-Bench 4.0, FrontierCode, DeepSWE)로, 비용은 API 가격(¢ 가장 쌈 ~ $$$$$ 가장 비쌈)으로 매긴 상대 등급입니다. 회사 간 측정 조건이 달라 한 칸 차이는 큰 의미가 없습니다.

리드·하위 세션 구성 예 (해석)

역할ClaudeCodex
리드 (계획·총정리·최종 리뷰)Opus 5.5GPT-6 Astra
구현 세션 (지시서대로 수행)Sonnet 5.5GPT-6.1 Sol
탐색·요약 서브에이전트Haiku 4.5GPT-6 Luna

사용량은 각 회사 기본 요금제(Claude Pro, ChatGPT Plus) 대비 배수입니다. 같은 배수라도 회사가 다르면 실제로 쓸 수 있는 양은 다릅니다(위 "한눈에"의 약 5배 차이 참고).

Claude (Claude Code)

요금제월 요금사용량비고출처
Pro$20 (연 결제 시 $17)기준 1배Claude Code 포함. Opus·Sonnet·Haiku, Fable은 사용량 크레딧출처
Max 5x$100Pro의 5배모든 모델출처
Max 20x$200Pro의 20배모든 모델. 5시간 단위 한도 + 주간 한도출처

ChatGPT · Codex

요금제월 요금사용량비고출처
Plus$20기준 1배Codex 웹·CLI·IDE출처
Pro 100$100Plus의 약 5배Ultrafast 없음 (보도 기준)출처
Pro 200$200Plus의 10배 (10/30부터, 이전 20배)기존 가입자는 10/29까지 이전 한도출처
Pro 500$500Plus의 25배Astra Ultrafast(최대 8배 속도) 포함출처

API 가격으로 계산한 값입니다. 구독 요금제에서는 이 비용만큼 사용량이 더 빨리 줄어드는 것으로 체감됩니다.

항목모델별 값비고 · 출처
과제당 API 비용 · Terminal-Bench ScienceGPT-6.1 Sol $5.47
Opus 5.5 $23.21
GPT-6 Astra $23.80
최대 노력 기준
출처
과제당 API 비용 · AutomationBenchGPT-6 Sol $0.27
GPT-6 Astra Sol의 3.9배
Fable 5.1 Sol의 8.9배 이상
Opus 5 Sol의 11.1배
OpenAI 발표. Opus 5.5가 아닌 Opus 5 수치
출처
과제당 비용 · Artificial Analysis 지수 측정GPT-6 Astra $4.72
Fable 5.1 $9.18
보도 기준
출처
과제당 시간 · OSWorld 2.0 (컴퓨터 사용)GPT-6 Astra 약 40분 (72.6%)
GPT-5.6 Sol 약 75분 (65.7%)

출처

Claude Code: /model opus 처럼 바꾸거나, 서브에이전트 파일의 model: 값(haiku·sonnet·opus·fable)으로 지정

어떤 작업에 어떤 모델

작업추천이유근거
코드 탐색, 로그·문서 요약, 대량 단순 작업, 서브에이전트Haiku 4.5가장 빠르고 저렴($1/$5). 공식 소개: 상위 모델이 계획하고 여러 Haiku가 하위 작업을 병렬 수행공식
범위가 정해진 일상 작업: 버그 수정, 단일 기능 구현, 문서 작성Sonnet 5.5공식 권장 용도. 에이전트 코딩 지표가 Opus 5.5와 비슷하거나 높고(Terminal-Bench 4.0 70.6%) 가격은 절반공식
판단이 필요한 복잡·장기 작업: 설계, 리드 세션, 계획·총정리, 최종 리뷰Opus 5.5공식: 신중한 판단이 필요한 복잡한 작업용이며, 열린 문제에서는 Sonnet 5.5보다 확실히 강함공식
가장 길고 어려운 연구·에이전트 작업Fable 5.1공식 용도는 장기 에이전트·연구. 단, 위 코딩 지표는 Opus 5.5가 더 높고 가격은 2.5배라 코딩 리드는 Opus 5.5가 비용 대비 유리 (해석)공식+해석

모델

모델지정 이름가격 (입력/출력)출시용도출처
Claude Fable 5.1fable$10 / $502026-09최상위 등급. 장기 에이전트·연구용공식
Claude Opus 5.5opus$4 / $202026-09-22복잡한 판단이 필요한 작업용공식
Claude Sonnet 5.5sonnet$2 / $102026-09-28범위가 정해진 일상 작업·대량 작업용공식
Claude Haiku 4.5haiku$1 / $52025-10-15빠르고 저렴. 서브에이전트 병렬 작업용공식

가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.

공식 벤치마크

벤치마크Fable 5.1Opus 5.5Sonnet 5.5Haiku 4.5비고 · 출처
Terminal-Bench 4.0
에이전트 코딩
55.8%66.4%70.6%—Opus 5.5는 xhigh 노력 기준
출처
FrontierCode 1.1 (Main)
에이전트 코딩
50.3%54.4%52.1% (xhigh) · 46.2% (max)—범위 밖 수정에 감점. Sonnet 5.5는 max보다 xhigh가 높음
출처
CursorBench 4.0
에이전트 코딩
51.8%57.8%55.5%—
출처
GDPval-AA v2.1
지식 업무 (Elo)
173518461844—Artificial Analysis 측정
출처
OSWorld 2.1 (partial)
컴퓨터 사용
80.7%81.8%80.1%—
출처
Humanity's Last Exam (도구 사용)
추론
65.6%67.7%64.5%—Fable 5.1 자체 발표값은 65.0%(조건 차이)
출처
AutomationBench
업무 자동화
31.4%40.0%——
출처
SWE-bench Verified
코딩 (구세대 지표)
———73.3%Haiku 4.5 발표(2025-10) 당시 지표라 위 모델과 직접 비교 불가
출처

Codex: /model로 바꾸거나 config.toml에 model = "gpt-6.1-sol" 처럼 지정

어떤 작업에 어떤 모델

작업추천이유근거
요약, 추출, 범위가 좁은 코딩 등 대량·반복 작업GPT-6 Luna공식 권장 용도. 가장 저렴($0.10/$0.50)공식
일상 개발과 오래 돌리는 작업의 기본값GPT-6.1 Sol공식: 반복·장기 실행 작업을 Astra보다 낮은 비용으로. 일부 지표는 Astra에 근접공식
복잡한 설계·판단, 여러 앱을 오가는 작업, 컴퓨터 사용GPT-6 Astra공식: 고급 추론·컴퓨터 사용·판단력을 결합한 복잡한 작업용. 가격은 Sol의 5배공식

모델

모델지정 이름가격 (입력/출력)출시용도출처
GPT-6 Astragpt-6-astra$10 / $502026-09-03복잡한 작업·판단·컴퓨터 사용공식
GPT-6.1 Solgpt-6.1-sol$2 / $102026-09반복·장기 실행 작업 (Astra보다 저렴)공식
GPT-6 Lunagpt-6-luna$0.10 / $0.502026-09요약·추출·범위 좁은 코딩 등 대량 작업공식

가격은 100만 토큰당 USD(API 기준). 구독 요금제에서는 사용량 한도로 차감됩니다.

공식 벤치마크

벤치마크GPT-6 AstraGPT-6.1 SolGPT-6 Luna비고 · 출처
Terminal-Bench 4.0
에이전트 코딩
57.9%——Sol·Luna는 공식 수치 없음
출처
DeepSWE v1.1
코딩
74.1%GPT-6 Sol(68.8%)보다 +6.4%p66.6% (max)6.1 Sol은 공식 발표가 상대 비교로만 제시
출처
FrontierCode 1.1 (Main)
에이전트 코딩
53.3%——Astra는 코드 품질·저장소 관례를 지시한 개발자 메시지 사용
출처
OSWorld 2.0 (offline)
컴퓨터 사용
72.6%Astra와 2.1%p 이내—
출처
AutomationBench
업무 자동화
41.4%Opus 5.5보다 +2.2%p—
출처
Terminal-Bench Science 0.1
과학 연구
64.6%GPT-6 Sol의 약 2배 · 과제당 $5.47 (Astra $23.80)—
출처

두 회사가 같은 이름의 벤치마크를 발표했지만 노력 수준·도구·버전 조건이 달라 같은 줄의 숫자를 그대로 비교하면 안 됩니다. 방향을 보는 참고용입니다.

같은 이름의 벤치마크 (높은 순)

벤치마크발표값출처
Terminal-Bench 4.0Sonnet 5.5 70.6% · Opus 5.5 66.4% (xhigh) · GPT-6 Astra 57.9% · Fable 5.1 55.8%Anthropic·OpenAI 발표
FrontierCode 1.1 (Main)Opus 5.5 54.4% · GPT-6 Astra 53.3% · Sonnet 5.5 52.1% (xhigh) · Fable 5.1 50.3%Anthropic·OpenAI 발표
AutomationBenchGPT-6 Astra 41.4% · Opus 5.5 40.0% · Fable 5.1 31.4%Anthropic·OpenAI 발표

역할별 짝 (리드·하위 세션 구성 예, 해석)

역할ClaudeCodex
리드 (계획·총정리·최종 리뷰)Opus 5.5GPT-6 Astra
구현 세션 (지시서대로 수행)Sonnet 5.5GPT-6.1 Sol
탐색·요약 서브에이전트Haiku 4.5GPT-6 Luna
버전날짜구분변경이유근거
v1.02026-10-06초기 작성: Claude 4종, Codex 3종 (공식 발표값)