AI의 다음 KPI는 ‘토큰 가격’이 아니다. 성공한 업무 하나를 얼마에 끝내는가
Apple은 추론이 일어나는 장소의 비용을 낮추고, Anthropic은 모델 실행비를 낮추며, Snorkel AI는 실패와 재시도를 줄이는 데이터·평가 환경에 돈이 몰리고 있음을 보여준다. 세 뉴스의 공통점은 하나다. AI 경쟁의 기준이 ‘더 큰 모델’에서 ‘더 싼 성공 결과’로 이동하고 있다.

20초 핵심
AI의 새 단위는 ‘토큰’이 아니라 ‘성공한 업무’다
기업이 실제로 지불하는 AI 비용은 API 가격표만으로 계산되지 않는다. 모델이 한 번에 일을 끝내지 못하면 토큰을 더 쓰고, 툴을 다시 호출하고, 사람이 결과를 고치고, 보안·데이터 통합·운영 비용까지 붙는다.
따라서 앞으로 봐야 할 숫자는 Cost per Successful Task, Time to Completion, Human Intervention Rate, 그리고 AI 1달러가 만들어내는 매출 또는 노동비 절감이다. 이 지표들이 모델, 클라우드, 반도체, 기업용 소프트웨어를 같은 언어로 비교하게 만들 가능성이 높다.
Snorkel AI - GPU 다음 병목은 ‘좋은 문제와 좋은 채점’이다
Snorkel AI는 9월 22일 3억5,000만달러의 Series E를 발표했고 기업가치는 35억달러가 됐다. 더 눈에 띄는 숫자는 매출이다. 회사는 2025년 시작한 데이터 서비스 사업 이후 18배 이상 성장해 연환산 매출 런레이트가 3억7,500만달러를 돌파했다고 밝혔다.
이 숫자가 의미하는 것은 데이터 라벨링의 부활이 아니다. 프런티어 모델이 코딩, 수학, 법률, 의료, 과학처럼 정답을 만들고 검증하기 어려운 영역으로 들어가면서 필요한 것은 단순한 ‘정답지’가 아니라 복잡한 업무를 어떻게 평가할지 설계하는 보상 함수, 루브릭, 강화학습 환경이다.
모델이 처음부터 더 정확하면 추론 토큰, 툴 호출, 롤백, 사람의 재작업이 함께 줄어든다. Snorkel이 AI 비용곡선에서 차지하는 위치는 여기다. 다만 투자자는 런레이트를 확정 연매출로 보면 안 된다. 고객 집중도와 서비스 매출의 인력 의존도, 그리고 소프트웨어형 고마진 매출로 얼마나 전환되는지가 더 중요하다.
Anthropic - 20% 가격 인하보다 40% 작업비 절감이 더 중요하다
Anthropic은 Claude Opus 5.5가 기본 설정의 일반적 워크로드에서 Opus 5보다 약 40% 낮은 비용으로 실행된다고 밝혔다. 가격표는 20% 내렸는데 업무 비용은 40% 줄었다. 회사 설명대로라면 새 모델이 더 적은 토큰으로 같은 일을 끝내기 때문이다.
에이전트 시대에는 이 차이가 크다. 장시간 코딩이나 업무 자동화에서는 같은 프롬프트를 한 번 처리하는 비용보다, 얼마나 오래 일하고 몇 번 실패하며 얼마나 많은 컨텍스트를 반복해서 읽는지가 비용을 결정한다. 그래서 캐시 읽기 60% 인하는 일반 채팅보다 에이전트 워크로드에서 더 의미가 크다.
다만 40% 절감은 Anthropic 자체 테스트다. 기업 고객은 자신의 코드베이스, 문서, 툴체인과 보안 조건에서 성공률과 인간 검수 시간까지 포함한 A/B 테스트를 해야 한다.
Apple - 모델 가격이 아니라 ‘추론 장소’의 가격을 바꾼다
Apple과 LM Studio는 WWDC 2026에서 Thunderbolt 5와 RDMA로 연결한 4대의 Mac Studio에서 1조 매개변수 Kimi K2.6을 구동했다. 이어 Apple은 8월 M5 Ultra Mac Studio를 공개하며 대당 최대 512GB 통합 메모리와 다중 Mac Studio 클러스터링을 공식 지원했다.
이것이 Nvidia 데이터센터를 대체한다는 뜻은 아니다. 대규모 학습과 수천·수만 명이 동시에 쓰는 서비스는 여전히 데이터센터 GPU가 유리하다. Apple이 현실적으로 노리는 곳은 반복 사용량이 높고 데이터 반출이 어렵고 동시접속이 상대적으로 낮은 기업 내부 추론이다.
투자 지도가 바뀌는 지점
| 투자 축 | 돈을 버는 방식 | 대표 기업군 | 확인할 KPI |
|---|---|---|---|
| 연산·메모리 | AI 사용량 증가가 총 컴퓨팅 수요를 확대 | Nvidia, Broadcom, AMD, TSMC, Micron 등 | 추론량, HBM 용량, AI CapEx, 네트워크 수요 |
| 클라우드 | 배포·관리·보안·데이터 서비스를 함께 판매 | Microsoft, Amazon, Alphabet, Oracle | AI 매출, 클라우드 성장률, CapEx 회수, 추론 마진 |
| 모델 | 더 적은 토큰·시간·실패율로 같은 업무 완료 | Anthropic, OpenAI, Google, xAI | 성공 업무당 비용, 캐시 활용, 고객 유지율 |
| 데이터·RL | 후학습과 평가 환경으로 실패·재시도 감소 | Snorkel AI, 전문 데이터 업체 | 성장률, 총마진, 고객 집중도, 계약기간 |
| 엔터프라이즈 AI | 실제 업무 자동화와 노동비 절감을 수익화 | Microsoft, ServiceNow, Palantir, Salesforce 등 | AI ARR, 자동화율, 인간 개입률, 좌석당 수익 |
| 로컬·엣지 | 반복 추론을 장비 고정비로 전환 | Apple, PC OEM, 관련 반도체 | 고용량 메모리 믹스, 가동률, 기업 레퍼런스, TCO |
이 세 뉴스의 연결고리는 ‘AI가 싸진다’가 아니다. 정확히는 검증 가능한 지능의 성공 단가가 내려가기 시작했다 는 것이다.
이 변화가 Nvidia와 하이퍼스케일러에 자동으로 악재인 것도 아니다. 단위 지능 비용이 낮아지면 이전에는 ROI가 나오지 않던 고객지원, 개발, 법무, 회계, 보안, 연구 업무까지 AI가 들어갈 수 있다. 가격은 내려가도 사용량이 더 빠르게 늘면 총 연산·메모리·네트워크 수요는 오히려 커질 수 있다.
다만 수익 배분은 달라질 수 있다. 모델 API 자체는 가격 경쟁으로 마진 압박을 받을 수 있다. 반면 고객 데이터, 평가 환경, 보안, 업무 워크플로우를 장악한 기업은 더 높은 전환비용을 만들 수 있다. 그래서 장기 투자자는 “누가 가장 똑똑한 모델을 갖고 있는가”보다 “누가 가장 낮은 성공 업무당 비용으로 고객의 반복 업무를 장악하는가”를 봐야 한다.
- 반드시 그렇지는 않다. 단가 하락으로 AI를 적용할 수 있는 업무가 크게 늘면 총 추론량이 더 빠르게 증가할 수 있다. 중요한 것은 단가가 아니라 가격 하락 이후의 사용량 탄력성이다.
- 여전히 중요하다. 다만 토큰 가격은 총비용의 한 요소가 된다. 작업당 토큰 수, 캐시 사용량, 실패율, 인간 검수 시간을 함께 봐야 실제 경제성을 알 수 있다.
- 대규모 학습과 높은 동시접속 서비스에서는 어렵다. 대신 데이터 보안이 중요하고 반복 사용량이 높으며 동시접속이 낮은 사내 추론에서는 현실적인 대안이 될 수 있다.
- 확정된 연간 매출이 아니라 최근 실적을 연환산한 매출 런레이트다. 성장 속도를 보여주지만 연말 실제 매출과 동일하게 취급해서는 안 된다.
체크 포인트
인사이트 타임스 편집부





