Claude Sonnet 5.5가 던진 질문, 가장 비싼 AI가 가장 쌀 수도 있는건가?
Sonnet 5.5는 Opus 5.5에 근접하는 성능을 더 낮은 가격과 더 빠른 속도로 제공한다. 하지만 여기서 결론을 “싼 모델이 이겼다”로 내리면 절반만 본 것이다. AI 모델 선택의 기준은 토큰 가격이 아니라 실패했을 때 생기는 총비용이다.

20초 핵심
가격은 절반인데, 성능 격차는 절반보다 작아졌다
Sonnet 5.5의 가장 강한 숫자는 가격이다. 입력 100만 토큰당 2달러, 출력 10달러다. Opus 5.5는 각각 4달러와 20달러, Fable 5.1은 10달러와 50달러다.
그런데 벤치마크 격차는 가격 차이만큼 크지 않다. Anthropic 공개 수치에서 Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록했고, Opus 5.5는 66.4%였다. CursorBench 4.0에서는 Sonnet 55.5%, Opus 57.8%였고, 지식노동 평가 GDPval-AA v2.1에서는 1844 대 1846으로 거의 차이가 없었다.
이 숫자만 보면 “그렇다면 Opus가 왜 필요한가”라는 질문이 자연스럽다. 답은 벤치마크가 주로 측정하는 것이 정답이 확인 가능한 작업의 수행 능력이기 때문이다. 실제 업무에는 정답 자체가 불분명한 문제가 훨씬 많다.
벤치마크가 잘 잡지 못하는 것은 ‘판단의 비용’이다
버그 수정, 정해진 명세의 CRUD 기능, 테스트 작성, UI 구현은 성공 조건이 비교적 명확하다. 잘못돼도 다시 고치기 쉽다. 이런 작업은 빠르고 저렴한 Sonnet 5.5가 강하다.
반면 데이터베이스 스키마, 인증과 권한, 결제, 개인정보 삭제, 대규모 리팩터링, 배포 구조는 다르다. 처음부터 “정답”이 주어지지 않는다. 여러 제약을 동시에 보고 장기적인 부작용까지 판단해야 한다. 한 번 잘못 설계하면 토큰 비용보다 재개발, 장애 복구, 데이터 손상, 보안 사고가 훨씬 비싸진다.
여기서 AI의 경제학이 달라진다. API 청구액만 보면 Sonnet이 싸다. 하지만 실제 총비용은 API 비용에 사람의 검토 시간, 재작업, 지연, 오류 손실까지 더해야 한다.
세 모델은 ‘서열’보다 역할이 다르다
| 모델 | 가장 잘 맞는 역할 | 기본 가격 | 핵심 판단 기준 |
|---|---|---|---|
| Sonnet 5.5 | 명확한 구현, 버그 수정, UI, 테스트, 문서, 반복 자동화 | $2 / $10 | 실패해도 빨리 확인하고 쉽게 되돌릴 수 있는가 |
| Opus 5.5 | 복합 기능 개발, 난해한 디버깅, 설계, 리팩터링, 리뷰 | $4 / $20 | 여러 시스템과 제약을 함께 판단해야 하는가 |
| Fable 5.1 | 장기 에이전트 작업, 핵심 아키텍처, 고위험 감사 | $10 / $50 | 틀렸을 때 데이터·보안·사업 손실이 큰가 |
Anthropic의 공식 가이드도 비슷한 방향이다. Sonnet은 잘 정의된 일상 작업과 빠른 반복에, Opus는 복잡하고 개방형이며 지속적인 판단이 필요한 일에, Fable은 더 높은 effort의 Opus로도 부족한 장기·고난도 추론에 두고 있다.
모델을 자주 바꾸기보다 effort를 먼저 조절하라
실무에서는 매 요청마다 모델을 바꾸는 방식이 오히려 복잡하다. 더 실용적인 방법은 기본 모델을 하나 정한 뒤, 작업의 위험도에 따라 effort를 올리거나 내리고 필요한 경우에만 모델을 승격하는 것이다.
예를 들어 일반적인 개발을 Opus 5.5 Medium에서 시작하고, 난해한 문제는 High, 장시간 에이전트 작업은 Xhigh 또는 Max로 올릴 수 있다. Sonnet 5.5 역시 Low부터 Max까지 다섯 단계의 effort를 지원한다. Anthropic은 잘 정의된 에이전트 코딩에는 Sonnet Medium, 더 어렵거나 긴 작업에는 High를 권한다.
중요한 점은 “무조건 Opus부터” 같은 고정 규칙이 아니다. 자신의 업무에서 실제 평가를 돌려 품질이 유지되는 가장 낮은 비용 지점을 찾는 것이 핵심이다.
Sonnet 5.5의 의미는 Opus를 죽였다는 데 있지 않다. 충분히 좋은 지능의 가격이 빠르게 떨어지고 있다는 데 있다.
AI가 하루에 몇 번 쓰는 챗봇일 때는 가장 좋은 모델 하나만 고르면 됐다. 그러나 AI가 IDE, 고객지원, 사내 에이전트, 데이터 처리, 제품 기능 안으로 들어가 하루 수천 번 호출되기 시작하면 이야기가 달라진다. 모델 성능 1~2%보다 작업당 비용과 지연시간, 재시도율이 사업성을 좌우한다.
반대로 보안, 권한, 결제, 데이터 모델처럼 실패 비용이 큰 영역에서는 토큰 비용 몇 달러를 아끼는 것이 아무 의미가 없을 수 있다. 앞으로 기업이 사는 것은 하나의 “최고 모델”이 아니라, 업무 위험도에 따라 값싼 지능과 비싼 지능을 자동 배치하는 지능형 라우팅 에 가까워질 가능성이 크다.
- 그렇게 단정하기 어렵다. 일부 평가에서는 Sonnet이 앞서거나 거의 같지만, Anthropic은 복잡하고 개방형이며 지속적인 판단이 필요한 작업에서 Opus가 여전히 더 강하다고 설명한다. 벤치마크는 실제 업무의 불확실성과 실패 비용을 완전히 반영하지 못한다.
- 아니다. Anthropic은 Sonnet 5.5가 Sonnet 5와 같은 새 토크나이저를 사용하며, 4.x 계열과 비교하면 같은 텍스트가 약 30% 더 많은 토큰으로 계산될 수 있다고 안내한다. 그래서 단순한 토큰 수보다 작업당 총비용을 보는 편이 정확하다.
- 하나의 정답은 없다. 범위가 명확하고 검증이 쉬운 대량 업무라면 Sonnet을 기본값으로 둘 수 있고, 여러 시스템이 얽힌 복합 개발이나 설계가 많다면 Opus가 더 편할 수 있다. 가장 좋은 방법은 실제 업무 평가를 돌려 품질이 유지되는 최저 비용 지점을 찾는 것이다.
- 토큰 가격만 보면 가장 비싸다. 그러나 장기 에이전트 작업, 핵심 아키텍처, 보안·권한·데이터 변경처럼 실패 비용이 매우 큰 일에서 오류 확률을 의미 있게 낮춘다면 총비용 기준으로는 합리적일 수 있다.
체크 포인트
인사이트 타임스 편집부





