AI가 더 똑똑해지는 속도보다 더 중요한 숫자가 생겼다
이번 주 AI 모델들은 더 강해졌는데 가격은 오히려 내려갔다. 장기투자자가 따라가야 할 그래프는 매주 바뀌는 벤치마크 1위가 아니라, 같은 일을 성공적으로 끝내는 데 드는 비용 일 수 있다.

20초 핵심
이번 주의 뉴스는 모델 교체가 아니라 ‘가격 곡선’이다
9월 22일 Anthropic은 Claude Opus 5.5를 공개했다. 회사 설명에 따르면 일반적인 워크로드에서 Opus 5보다 약 40% 적은 비용으로 작동한다. API 가격은 100만 토큰당 입력 4달러, 출력 20달러로 이전 Opus 5보다 각각 20% 낮아졌다.
같은 날 OpenAI는 GPT-6 Sol과 Luna를 내놨다. GPT-6 Sol은 입력 4달러에서 2달러, 출력 20달러에서 10달러로 내려갔다. Luna도 입력 0.20달러에서 0.10달러, 출력 1.20달러에서 0.50달러로 낮아졌다. OpenAI는 이를 GPT-5.6의 프로모션 가격과 비교해 50% 인하라고 설명한다.
xAI의 Grok 4.7도 9월 21일 등장했다. 가격은 이전 Grok 4.6과 같은 입력 2달러, 출력 6달러를 유지하면서 장시간 코딩과 지식 작업 성능을 높였다. 중요한 공통점은 분명하다. 새 모델이 나올수록 더 비싸지는 것이 아니라, 같은 가격에서 더 많은 일을 하거나 같은 일을 더 싸게 한다.
벤치마크보다 오래 남는 숫자 : Intelligence Price Index
AI 업계에는 매주 새로운 벤치마크 1위가 나온다. 하지만 장기투자자에게 더 중요한 질문은 “누가 1위인가”보다 “일정 수준의 지능을 얼마에 살 수 있는가”다.
이를 가칭 Intelligence Price Index라고 부를 수 있다. 공식 산업지표는 아니다. 하지만 방향은 이미 측정되고 있다. Stanford AI Index에 따르면 GPT-3.5 수준의 MMLU 성능을 얻는 추론 가격은 2022년 11월 100만 토큰당 20달러에서 2024년 10월 0.07달러까지 떨어졌다. 약 18개월 만에 280분의 1 이하가 된 셈이다.
다만 토큰 가격만으로는 부족하다. 추론형 모델은 답을 얻기 위해 쓰는 토큰 수 자체가 달라지고, 에이전트는 실패하면 재시도한다. 그래서 산업이 실제로 봐야 할 지표는 Cost per Successful Task, 즉 성공한 업무 하나당 총비용이다. Artificial Analysis도 최신 모델을 단순 토큰 가격이 아니라 Intelligence Index의 작업당 비용으로 비교하고 있다.
AI 경제성의 더 나은 측정법
1달러가 되는 순간, 자동화의 경계가 바뀐다
가격 하락의 의미는 단순히 기업의 AI 비용이 줄어드는 데 있지 않다. 경제적으로 자동화할 수 있는 업무의 범위가 넓어진다.
어떤 업무를 AI가 100달러에 처리한다면 사람이 직접 하는 편이 나을 수 있다. 10달러가 되면 일부 반복 업무에서 경쟁이 시작된다. 1달러가 되면 훨씬 많은 프로세스가 자동화 후보가 된다. 10센트까지 내려가면 사람에게 일일이 맡기는 것이 오히려 비경제적인 업무가 생길 수 있다.
이 숫자는 예시이지 산업 전체의 실제 평균비용을 뜻하지 않는다. 핵심은 임계값이다. 기업은 AI가 인간보다 “더 똑똑한가”만 보지 않는다. 충분히 정확하면서 더 싸고, 더 빠르고, 24시간 확장할 수 있는지를 본다.
AI가 싸지면 Nvidia에는 악재일까
직관적으로는 그렇다. 같은 답을 더 적은 계산으로 얻는다면 GPU가 덜 필요해 보인다. 그러나 수요가 가격 하락보다 더 빠르게 늘면 결과는 반대가 된다. 경제학에서 말하는 Jevons Paradox와 닮은 구조다.
과거 비용 때문에 하루 10번만 실행하던 에이전트를 1,000번 실행할 수 있다고 생각해보자. 모든 코드 커밋을 검토하고, 모든 고객에게 개인화된 응답을 만들고, 모든 광고를 개별 생성하고, 모든 금융거래를 상시 분석하는 방식이다.
AI 수요의 역설
Total Intelligence Consumed ↑↑
따라서 모델 가격 인하는 곧바로 compute demand 감소로 번역하면 안 된다. 중요한 것은 가격 하락률과 사용량 증가율 가운데 어느 쪽이 더 빠른가다. 사용량이 더 빠르게 늘면 모델 호출 단가는 떨어져도 데이터센터가 처리해야 하는 총 추론량은 커진다.
이 관점에서 Nvidia의 장기 논점도 조금 달라진다. Training은 거대한 모델을 만드는 집중형 계산이고, inference는 완성된 모델을 수많은 사용자와 에이전트가 반복해서 쓰는 계산이다. AI가 실제 업무 시스템으로 들어갈수록 투자자가 확인해야 할 것은 학습 클러스터 규모뿐 아니라 일상적인 추론 호출량과 그 성장률이다.
토큰 가격 다음에 봐야 할 숫자
| 지표 | 무엇을 측정하나 | 투자자에게 중요한 이유 |
|---|---|---|
| Price per Token | API의 표면 단가 | 비교는 쉽지만 모델별 토큰 사용량과 재시도를 놓친다 |
| Cost per Successful Task | 업무 하나를 실제로 성공시키는 총비용 | Agent 경제성에 가장 가까운 지표다 |
| AI Cost / Human Labor Cost | 같은 업무의 AI 비용과 인간 노동비 비교 | 1 아래로 내려가는 업무에서 자동화 유인이 커진다 |
| Inference Volume | 실제 호출량, 토큰, 계산량 | 가격 하락이 GPU 수요를 줄이는지 오히려 키우는지 판별한다 |
이번 모델 교체에서 더 중요한 것은 누가 벤치마크 1위를 차지했는지가 아니다. Anthropic, OpenAI, xAI가 서로 다른 방식으로 가격 대비 지능의 프런티어를 아래로 밀고 있다는 사실 이다.
다만 가격 하락만 보고 AI 인프라 수요가 무한히 커진다고 단정할 수도 없다. 효율 개선이 사용량 증가를 앞서거나, 기업의 Agent ROI가 기대에 못 미치거나, 전력과 데이터센터 공급이 병목이 되면 총 compute 성장률은 둔화할 수 있다.
그래서 투자자의 질문은 “모델이 얼마나 똑똑해졌나”에서 한 단계 바뀌어야 한다. 성공한 업무 한 건의 비용이 얼마나 빨리 내려가고 있으며, 그 결과 기업이 AI를 몇 배 더 많이 사용하고 있는가. 이 두 숫자의 곱이 앞으로 모델 기업, 클라우드, Nvidia와 AI 데이터센터의 경제성을 함께 결정할 가능성이 높다.
- 단가는 내려가도 사용량이 더 빠르게 증가하면 매출은 늘 수 있다. 핵심은 가격 하락의 탄력성이다. 호출량 증가가 단가 하락을 얼마나 상쇄하는지 봐야 한다.
- 모델마다 같은 업무에 쓰는 토큰 수와 추론 단계가 다르고 실패율도 다르다. 싼 토큰을 많이 쓰고 여러 번 재시도하면 실제 업무비용은 오히려 높을 수 있다.
- 아니다. 사용량 증가가 효율 향상을 넘어설 때만 총 compute가 크게 늘어난다. 모델 압축, 전용칩, 소프트웨어 최적화, 전력 제약도 함께 봐야 한다.
- AI 업무의 신뢰성과 ROI가 일정 수준에서 정체되는 경우다. 가격이 아무리 싸도 실패율이 높거나 인간의 지속적인 감독이 필요하면 자동화의 경제적 임계점은 생각보다 늦게 온다.
체크 포인트
인사이트 타임스 편집부





