Claude Sonnet 5.5가 던진 질문, 가장 비싼 AI가 가장 쌀 수도 있는건가?

Sonnet 5.5는 Opus 5.5에 근접하는 성능을 더 낮은 가격과 더 빠른 속도로 제공한다. 하지만 여기서 결론을 “싼 모델이 이겼다”로 내리면 절반만 본 것이다. AI 모델 선택의 기준은 토큰 가격이 아니라 실패했을 때 생기는 총비용이다.

20초 핵심

1
Claude Sonnet 5.5의 API 가격은 입력 100만 토큰당 2달러, 출력 10달러다. Opus 5.5의 정확히 절반이며 Anthropic은 Sonnet 5.5가 Sonnet 5보다 30% 이상 빠르다고 설명한다.
2
일부 코딩과 지식노동 벤치마크에서는 Opus 5.5에 거의 근접한다. 그러나 Anthropic 자신도 복잡하고 개방형이며 지속적인 판단이 필요한 일에서는 Opus가 여전히 더 강하다고 선을 긋는다.
3
따라서 모델 선택은 “누가 가장 똑똑한가”보다 “이 작업이 틀렸을 때 얼마나 비싼가”로 바뀌어야 한다. 저위험 반복 업무는 Sonnet, 복합 판단은 Opus, 장기·고위험 작업은 Fable이 더 자연스럽다.

가격은 절반인데, 성능 격차는 절반보다 작아졌다

Sonnet 5.5의 가장 강한 숫자는 가격이다. 입력 100만 토큰당 2달러, 출력 10달러다. Opus 5.5는 각각 4달러와 20달러, Fable 5.1은 10달러와 50달러다.

$2 / $10
Claude Sonnet 5.5
입력 / 출력 100만 토큰
$4 / $20
Claude Opus 5.5
Sonnet 대비 2배
$10 / $50
Claude Fable 5.1
Sonnet 대비 5배

그런데 벤치마크 격차는 가격 차이만큼 크지 않다. Anthropic 공개 수치에서 Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록했고, Opus 5.5는 66.4%였다. CursorBench 4.0에서는 Sonnet 55.5%, Opus 57.8%였고, 지식노동 평가 GDPval-AA v2.1에서는 1844 대 1846으로 거의 차이가 없었다.

이 숫자만 보면 “그렇다면 Opus가 왜 필요한가”라는 질문이 자연스럽다. 답은 벤치마크가 주로 측정하는 것이 정답이 확인 가능한 작업의 수행 능력이기 때문이다. 실제 업무에는 정답 자체가 불분명한 문제가 훨씬 많다.

벤치마크가 잘 잡지 못하는 것은 ‘판단의 비용’이다

버그 수정, 정해진 명세의 CRUD 기능, 테스트 작성, UI 구현은 성공 조건이 비교적 명확하다. 잘못돼도 다시 고치기 쉽다. 이런 작업은 빠르고 저렴한 Sonnet 5.5가 강하다.

반면 데이터베이스 스키마, 인증과 권한, 결제, 개인정보 삭제, 대규모 리팩터링, 배포 구조는 다르다. 처음부터 “정답”이 주어지지 않는다. 여러 제약을 동시에 보고 장기적인 부작용까지 판단해야 한다. 한 번 잘못 설계하면 토큰 비용보다 재개발, 장애 복구, 데이터 손상, 보안 사고가 훨씬 비싸진다.

가장 싼 모델은 토큰 단가가 낮은 모델이 아니라, 원하는 품질을 가장 적은 총비용으로 안정적으로 달성하는 모델이다.

여기서 AI의 경제학이 달라진다. API 청구액만 보면 Sonnet이 싸다. 하지만 실제 총비용은 API 비용에 사람의 검토 시간, 재작업, 지연, 오류 손실까지 더해야 한다.

세 모델은 ‘서열’보다 역할이 다르다

모델가장 잘 맞는 역할기본 가격핵심 판단 기준
Sonnet 5.5명확한 구현, 버그 수정, UI, 테스트, 문서, 반복 자동화$2 / $10실패해도 빨리 확인하고 쉽게 되돌릴 수 있는가
Opus 5.5복합 기능 개발, 난해한 디버깅, 설계, 리팩터링, 리뷰$4 / $20여러 시스템과 제약을 함께 판단해야 하는가
Fable 5.1장기 에이전트 작업, 핵심 아키텍처, 고위험 감사$10 / $50틀렸을 때 데이터·보안·사업 손실이 큰가

Anthropic의 공식 가이드도 비슷한 방향이다. Sonnet은 잘 정의된 일상 작업과 빠른 반복에, Opus는 복잡하고 개방형이며 지속적인 판단이 필요한 일에, Fable은 더 높은 effort의 Opus로도 부족한 장기·고난도 추론에 두고 있다.

모델을 자주 바꾸기보다 effort를 먼저 조절하라

실무에서는 매 요청마다 모델을 바꾸는 방식이 오히려 복잡하다. 더 실용적인 방법은 기본 모델을 하나 정한 뒤, 작업의 위험도에 따라 effort를 올리거나 내리고 필요한 경우에만 모델을 승격하는 것이다.

예를 들어 일반적인 개발을 Opus 5.5 Medium에서 시작하고, 난해한 문제는 High, 장시간 에이전트 작업은 Xhigh 또는 Max로 올릴 수 있다. Sonnet 5.5 역시 Low부터 Max까지 다섯 단계의 effort를 지원한다. Anthropic은 잘 정의된 에이전트 코딩에는 Sonnet Medium, 더 어렵거나 긴 작업에는 High를 권한다.

중요한 점은 “무조건 Opus부터” 같은 고정 규칙이 아니다. 자신의 업무에서 실제 평가를 돌려 품질이 유지되는 가장 낮은 비용 지점을 찾는 것이 핵심이다.

INSIGHT TIMES VIEW

Sonnet 5.5의 의미는 Opus를 죽였다는 데 있지 않다. 충분히 좋은 지능의 가격이 빠르게 떨어지고 있다는 데 있다.

AI가 하루에 몇 번 쓰는 챗봇일 때는 가장 좋은 모델 하나만 고르면 됐다. 그러나 AI가 IDE, 고객지원, 사내 에이전트, 데이터 처리, 제품 기능 안으로 들어가 하루 수천 번 호출되기 시작하면 이야기가 달라진다. 모델 성능 1~2%보다 작업당 비용과 지연시간, 재시도율이 사업성을 좌우한다.

반대로 보안, 권한, 결제, 데이터 모델처럼 실패 비용이 큰 영역에서는 토큰 비용 몇 달러를 아끼는 것이 아무 의미가 없을 수 있다. 앞으로 기업이 사는 것은 하나의 “최고 모델”이 아니라, 업무 위험도에 따라 값싼 지능과 비싼 지능을 자동 배치하는 지능형 라우팅 에 가까워질 가능성이 크다.

Sonnet 5.5가 일부 벤치마크에서 Opus보다 높다면 Opus는 필요 없는가?
  • 그렇게 단정하기 어렵다. 일부 평가에서는 Sonnet이 앞서거나 거의 같지만, Anthropic은 복잡하고 개방형이며 지속적인 판단이 필요한 작업에서 Opus가 여전히 더 강하다고 설명한다. 벤치마크는 실제 업무의 불확실성과 실패 비용을 완전히 반영하지 못한다.
Sonnet 5.5는 항상 토큰도 적게 쓰는가?
  • 아니다. Anthropic은 Sonnet 5.5가 Sonnet 5와 같은 새 토크나이저를 사용하며, 4.x 계열과 비교하면 같은 텍스트가 약 30% 더 많은 토큰으로 계산될 수 있다고 안내한다. 그래서 단순한 토큰 수보다 작업당 총비용을 보는 편이 정확하다.
그렇다면 기본 모델은 무엇으로 두는 것이 좋은가?
  • 하나의 정답은 없다. 범위가 명확하고 검증이 쉬운 대량 업무라면 Sonnet을 기본값으로 둘 수 있고, 여러 시스템이 얽힌 복합 개발이나 설계가 많다면 Opus가 더 편할 수 있다. 가장 좋은 방법은 실제 업무 평가를 돌려 품질이 유지되는 최저 비용 지점을 찾는 것이다.
Fable은 언제 경제적인가?
  • 토큰 가격만 보면 가장 비싸다. 그러나 장기 에이전트 작업, 핵심 아키텍처, 보안·권한·데이터 변경처럼 실패 비용이 매우 큰 일에서 오류 확률을 의미 있게 낮춘다면 총비용 기준으로는 합리적일 수 있다.

체크 포인트

작업당 실제 비용 - 토큰 단가가 아니라 재시도, 도구 호출, 캐시, 사람 검토까지 합친 비용이 얼마나 낮아지는지 봐야 한다.
Sonnet과 Opus의 실제 업무 격차 - 벤치마크가 아니라 사내 코드베이스, 문서, 에이전트 업무에서 격차가 계속 줄어드는지가 중요하다.
자동 모델 라우팅 - 업무 난도와 위험도에 따라 모델과 effort를 자동으로 바꾸는 기능이 기업용 AI의 핵심 운영 계층으로 자리 잡는지 확인할 필요가 있다.
Haiku 5.5의 등장 - Anthropic은 고용량·비용 민감형 Haiku 5.5를 예고했다. 이 모델이 나오면 저비용 대량 처리 시장의 가격 경쟁은 한 단계 더 강해질 수 있다.

인사이트 타임스 편집부