전체 검색

글, 태그와 카테고리를 검색하고 바로 이동해요

Cursor · Claude · Codex — 2026년 중반, 셋을 같이 쓰는 이유

셋 중 하나를 못 고른 게 아니라 안 골랐어요. 세 도구가 파는 축이 다르거든요. 벤치마크는 자체 발표와 리더보드를 갈라서 봤습니다.

2026. 07. 14. 16:06:555분 읽기AI 개발/방법론
#GPT-5.6#Claude Fable#모델 비교
조회 34
세 조수가 분업하는 책상 일러스트

고백부터 하죠. 제 작업 환경에는 AI 코딩 툴이 세 개 다 깔려 있어요. Cursor, Claude, Codex. 하나로 정리하지 못한 게 아니라, 안 한 겁니다.

앞 글에서 툴을 세 번 갈아탄 얘기를 했는데요. 갈아탄 뒤에도 셋을 전부 쓰는 이유를 2026년 7월 기준 실사용 경험으로 정리해 볼게요. 결론을 미리 흘리면 — 셋은 같은 축에서 경쟁하지 않아요.

세 도구, 세 가지 성격

Cursor — 속도와 세밀한 제어

IDE에서 출발한 도구답게 탭 자동완성 형태의 코드 조언이 제일 편해요. 외부 모델을 API로 전부 붙여 쓸 수 있는 것도 장점이고요. 대신 래핑을 거치면서 체감 성능은 조금씩 깎입니다.

자체 모델 Composer는 프런티어 모델보다 지능은 밀리지만 빨라요. 그래서 작업을 세세하게 쪼개서 지시할 수 있는 분께 추천해요. 지시가 정밀할수록 지능 격차는 줄고, 속도 이점만 남거든요.

팩트 체크: 최신 Composer 2.5(2026.05)는 오픈소스 Kimi K2.5에 자체 포스트트레이닝을 얹은 모델이에요. Terminal-Bench 2.0 기준 69.3을 공식 발표했는데, 공식 리더보드(tbench.ai, WebDev Arena)에는 미등재라 프런티어 모델과의 직접 비교치는 없어요. 애초에 포지셔닝이 지능 경쟁이 아니라 속도·가격이기도 하고요.

Claude — 사전학습의 깊이

Fable 5(2026.06)는 현존 최대 규모 사전학습 모델로 이야기돼요(규모 자체는 공식 미공개). 그만큼 기존에 존재하던 경험적 지식을 정말 잘 끌어옵니다.

다만 그 깊이가 양날의 검이에요. "게임 만들어줘" 하면 기존 게임과 흡사한 결과물이 나오는 식이라, 저작권 관점에서 신경 쓰일 소지가 있어요. 사전학습이 깊을수록 기억 재생의 리스크도 커지는 트레이드오프죠. 결과물 유사성 검토는 결국 사람 몫입니다.

팩트 체크: SWE-bench Verified 95.0%는 독립 평가(vals.ai)로 확인된, 현재 가장 견고한 수치예요. Terminal-Bench 2.1 공식 리더보드에서도 Claude Code 하네스 조합으로 83.8%를 기록하며 1위고요(자체 발표치는 88.0으로 별개). 가격은 $10/$50(1M 토큰)으로 셋 중 가장 비쌉니다.

(출시 직후 수출통제로 19일간 배포가 멈췄다 재개된 소동도 있었어요.)

Codex — 사후학습의 미친 완성도

사후학습이 미쳤어요. 제가 Codex를 주력으로 쓰는 이유는 이게 전부입니다.

GPT-5.6은 세 가지 라인업으로 나와요. Sol, Terra, Luna(2026.07.09 GA). Sol을 high 정도로만 돌려도 기존 GPT-5.5가 풀던 문제를 더 빠르고 더 완벽하게 풀어요. 출시 첫날에 비하면 지능이 살짝 내려온 느낌은 있지만요.

(저는 그동안 'sol, tera, runa'로 기억하고 있었어요. 이번에 찾아보니 Sol / Terra / Luna가 맞더라고요.)

팩트 체크: 가격은 Sol $5/$30, Terra $2.50/$15, Luna $1/$6. Terra가 'GPT-5.5급 성능을 절반 가격에' 포지션이에요. reasoning effort는 6단계에, 병렬 에이전트를 돌리는 Ultra 모드까지 있어요. Sol의 Terminal-Bench 88.8(Ultra 91.9)은 자체 하네스 발표치고, 공식 리더보드에는 미제출 상태예요. 리더보드에 올라온 건 Terra 78.4, Luna 75.7. WebDev Arena에서는 sol-xhigh가 Elo 1631로 1위인데, Fable 5가 1630으로 사실상 동률입니다.

벤치마크, 그대로 믿으면 안 됩니다

코딩 벤치마크 현황 2026.07.14 — Terminal-Bench 2.1 리더보드와 SWE-bench Verified
2026-07-14 기준 Terminal-Bench 2.1 리더보드와 SWE-bench Verified 현황.

수치를 교차 검증하면서 배운 게 세 가지예요.

모델Terminal-Bench 2.1 공식 리더보드자체 발표치
Claude Fable 583.8 (Claude Code 하네스, 1위)88.0
GPT-5.6 Sol미제출88.8 (Ultra 91.9)
GPT-5.6 Terra78.4
GPT-5.6 Luna75.7
Composer 2.5미등재69.3 (TB 2.0 기준)

표로 놓고 보면 명확하죠. 같은 모델인데 열이 다르면 숫자가 달라요. 교차 검증하면서 배운 게 세 가지입니다.

  1. 같은 벤치마크라도 벤더 자체 발표(자체 하네스·스캐폴딩)와 공식 리더보드·독립 평가가 계열마다 4~6%p씩 벌어져요.
  2. SWE-bench Pro 계열은 스캐폴딩 논쟁이 있어서 순위 근거로 쓰기 어려워요.
  3. METR이 Sol 평가에서 벤치마크 게이밍(평가 버그 악용)을 역대 최고 비율로 탐지했다는 보고도 있어요. 자체 발표치는 특히 걸러 봐야 합니다.

그래서 뭘 쓰냐면

도구파는 축이런 분께
Cursor인터랙션 레이어 — 속도, 세밀한 제어, 낮은 가격작업을 잘게 쪼개 정밀하게 지시하는 스타일
Claude사전학습의 깊이 — 맥락과 경험 지식맡기고 검증하는 스타일, 깊은 맥락이 필요한 작업
Codex사후학습의 실행력 — 에이전트 완성도, 토큰 경제큰 작업을 통째로 맡기고 많이 돌리는 스타일

셋은 이제 서로 다른 축을 팔아요. Cursor는 인터랙션 레이어(속도·세밀한 제어·낮은 가격), Claude는 사전학습의 깊이(맥락과 경험 지식), Codex는 사후학습의 실행력(에이전트 완성도와 토큰 경제).

그래서 벤치마크 표로 하나를 고르는 게 아니라, "내가 어떻게 조종하는 사람인가"로 골라야 해요. 세밀하게 지시하는 스타일이면 Composer가 싸고 빠르고, 맡기고 검증하는 스타일이면 Sol이나 Fable이 맞습니다.

제 방법론 관점에서 하나 더. 리더보드의 1~2%p 차이는 중앙 정리본과 프로세스가 흡수해요. 컨텍스트 무결성이 깨진 1위 모델보다, 정리본을 재주입받은 2위 모델이 낫거든요. 도구 선택보다 조종 방식이 먼저다 — 셋을 다 써보고 남은 결론이에요.


(수치는 전부 2026-07-14 기준이고 tbench.ai · vals.ai · arena.ai · 각 사 공식 블로그를 교차 확인했어요. 이 글의 벤치마크 수집과 검증도 AI에게 시켰습니다. 마지막 판단은 제가 했고요.)

시리즈 이어읽기

AI 툴 유목민 일지

2 / 3

이야기 나누기

반응을 남기고 새 글 소식을 받아보세요.

댓글0
서로를 존중하는 대화를 남겨주세요.

첫 댓글을 남겨 대화를 시작해보세요.

새 글 구독
새 글이 공개되면 이메일로 알려드려요.