EXPLAIN투자돈이 남는 지능 · 2화

토큰값이 내려갈수록 AI 청구서는 커진다

AI 산업의 중심이 학습에서 추론으로 이동하면서 ‘토큰’은 더 이상 개발자만 아는 기술 단위가 아니다. 데이터센터가 생산하고 기업이 소비하는 산업재에 가까워지고 있다. 문제는 가격이 내려갈수록 수요가 줄어드는 것이 아니라, Agent와 자동화가 오히려 훨씬 더 많은 토큰을 소비할 수 있다는 점이다.

20초 핵심

1
NVIDIA는 AI 데이터센터를 ‘전기를 토큰으로 바꾸는 AI Factory’로 정의한다. 토큰/초, 토큰/W, 토큰당 비용, 가동률이 새로운 생산성 지표가 되고 있다.
2
Microsoft Research는 Agent 코딩 작업이 일반 코드 채팅·추론보다 최대 1,000배 많은 토큰을 소비할 수 있다고 분석했다. 한 번의 질문이 아니라 수십~수백 번의 모델 호출이 한 업무 안에 숨어 있기 때문이다.
3
AI의 가격 경쟁은 ‘100만 토큰당 몇 달러인가’에서 ‘업무 하나를 끝내는 데 얼마가 드는가’로 이동한다. 가장 싼 모델보다 가장 싼 결과를 만드는 시스템이 중요해진다.

토큰이라는 낯선 단위가 산업의 생산량이 되고 있다

철강은 톤으로 생산량을 잰다. 전력은 kWh, 석유는 배럴, 통신은 GB로 사용량을 측정한다.

AI 산업에서는 점점 ‘토큰’이 이런 역할에 가까워지고 있다.

토큰은 모델이 텍스트를 처리할 때 사용하는 작은 정보 단위다. 사용자가 문장을 입력하면 모델은 이를 토큰으로 쪼개 읽고, 답변 역시 토큰을 하나씩 생성한다. 개발자에게는 오래전부터 익숙한 개념이었지만 일반 사용자에게는 거의 보이지 않았다.

그런데 AI가 산업으로 커지면서 상황이 바뀌었다.

API 가격은 100만 토큰당 얼마인지로 표시된다. 데이터센터는 초당 몇 개의 토큰을 만들어낼 수 있는지 경쟁한다. 같은 전력으로 얼마나 많은 토큰을 생성하는지가 효율성의 기준이 된다. 캐시를 얼마나 활용하느냐에 따라 같은 작업의 원가가 달라진다.

NVIDIA는 이를 노골적으로 ‘AI Factory’라고 부른다. 산업시대의 공장이 원재료를 제품으로 바꿨다면 AI Factory는 전력과 컴퓨팅을 토큰으로 바꾼다는 설명이다. NVIDIA가 제시하는 핵심 지표도 토큰/초, 토큰/W, 토큰당 비용, 가동률, 업타임이다.

이 표현이 단순한 마케팅 문구로만 보이지 않는 이유가 있다.

AI가 실제 기업 업무에 들어갈수록 중요한 것은 모델이 한 번 얼마나 똑똑하게 답했는지가 아니라, 하루 동안 얼마나 많은 ‘지능의 작업량’을 안정적으로 처리했는가이기 때문이다.

학습의 시대에서 추론의 시대로

AI 산업 초기에 시장의 관심은 거의 학습에 집중됐다.

GPT급 모델 하나를 학습하려면 GPU가 몇 장 필요한가. 파라미터가 몇 개나 되는가. 훈련 비용이 얼마인가. 모델 크기를 두 배로 늘리면 성능이 얼마나 좋아지는가.

학습은 거대한 프로젝트다. 하지만 횟수는 제한적이다.

추론은 다르다.

사용자가 검색을 할 때마다 추론이 발생한다. Copilot이 문서를 요약할 때도, 코드를 작성할 때도, 고객센터가 문의를 처리할 때도 모델이 호출된다. 광고를 개인화하고, 문서를 분류하고, 계약서를 검토하고, 보안 경보를 분석할 때마다 계산이 반복된다.

학습이 공장을 짓는 일이라면 추론은 공장이 매일 제품을 생산하는 일에 가깝다.

AI가 경제 전체에 깊숙이 들어갈수록 산업 규모를 결정하는 것은 몇 번의 거대한 학습 작업보다 수십억 명의 사용자와 기업 시스템에서 매일 반복되는 추론일 가능성이 높다.

NVIDIA 역시 2026년 들어 AI 산업이 ‘모델 개발에서 생산 추론으로 이동하고 있다’고 표현한다. 대규모 AI 인프라가 일회성 훈련 시설이 아니라 24시간 토큰을 생산하는 설비가 되는 것이다.

Agent가 등장하면 ‘한 번의 질문’이라는 개념이 깨진다

여기서 Agent가 등장하면서 추론 경제가 한 단계 더 복잡해진다.

사람이 챗봇에 질문 하나를 던지는 장면을 생각해보자. 질문을 입력한다. 모델이 답한다. 대화는 끝난다.

Agent는 이렇게 움직이지 않는다.

예를 들어 “우리 회사의 지난 분기 고객 이탈 원인을 찾아 보고서를 만들어라”라는 업무를 맡기면 Agent는 여러 단계를 수행할 수 있다.

관련 데이터를 찾는다. 문서를 읽는다. 데이터베이스를 조회한다. 중간 가설을 만든다. 필요한 추가 정보를 다시 찾는다. 다른 모델이나 도구를 호출한다. 계산 결과를 검증한다. 문제가 있으면 이전 단계로 돌아간다. 최종 결과를 작성한다.

사용자가 보기에는 ‘업무 한 건’이지만 내부에서는 모델 호출이 수십 번, 복잡한 작업에서는 수백 번 이어질 수 있다.

Microsoft Research가 2026년 공개한 Agent 코딩 작업 연구는 이 차이를 수치로 보여준다. 연구진은 Agent형 코딩 과제가 일반 코드 추론이나 코드 채팅보다 최대 1,000배 많은 토큰을 소비할 수 있다고 분석했다.

더 흥미로운 부분은 토큰 사용량이 일정하지 않다는 점이다. 같은 작업을 같은 모델에 맡겨도 실행에 따라 총 토큰 사용량이 최대 30배까지 차이 났다. 토큰을 더 많이 쓴다고 정확도가 계속 좋아지는 것도 아니었다.

이 결과는 AI Agent가 단순한 ‘더 긴 프롬프트’가 아니라 새로운 비용 구조를 가진 소프트웨어라는 사실을 보여준다.

AI판 제번스 역설: 싸져서 덜 쓰는 게 아니라 더 많이 쓴다

여기서 AI 산업의 가장 중요한 역설 하나가 나온다.

모델이 효율적으로 바뀌고 토큰 가격이 낮아지면 GPU 수요가 줄어들까.

직관적으로는 그럴 것 같다. 같은 일을 10분의 1 비용으로 할 수 있다면 필요한 연산량도 줄어들 것처럼 보인다.

하지만 기술의 역사에서는 반대가 자주 일어났다.

19세기 경제학자 윌리엄 스탠리 제번스는 증기기관의 석탄 효율이 좋아질수록 영국의 석탄 소비가 오히려 증가하는 현상을 관찰했다. 효율 향상이 사용 비용을 낮추고, 그 결과 적용할 수 있는 영역이 폭발적으로 늘어났기 때문이다.

AI에서도 비슷한 현상이 나타날 수 있다.

예전에는 비용 때문에 사람이 직접 하던 업무를 AI가 처리하기 시작한다. 한 번만 분석하던 데이터를 매시간 분석한다. 중요한 고객에게만 제공하던 개인화를 모든 고객에게 제공한다. 사람이 요청할 때만 작동하던 AI가 Agent가 되어 24시간 업무를 수행한다.

토큰당 가격이 10분의 1이 되더라도 사용량이 100배 늘면 총 지출은 오히려 10배가 된다.

따라서 추론 효율이 좋아진다는 사실과 전체 컴퓨팅 수요가 줄어든다는 결론 사이에는 큰 간극이 있다.

실제로 AI 모델 업체들은 더 빠른 모델, 캐시, 배치 처리, 전용 추론칩을 통해 단가를 낮추는 동시에 더 긴 컨텍스트, 더 깊은 reasoning, multi-agent 구조처럼 토큰 소비를 늘리는 기능을 확대하고 있다.

AI는 효율이 높아져서 사용량이 줄어드는 산업보다, 효율이 높아질수록 이전에는 경제성이 없던 수많은 작업이 새롭게 AI로 넘어오는 산업에 가까울 수 있다.

그렇다고 ‘토큰 수요 폭증 = 모든 AI 기업의 호황’은 아니다

여기서 중요한 함정이 하나 있다.

토큰 소비가 늘어난다고 모든 AI 기업의 이익이 늘어나는 것은 아니다.

같은 100만 토큰이라도 경제성이 완전히 다르기 때문이다.

2026년 9월 기준 Anthropic의 Claude Sonnet 5는 100만 입력 토큰당 2달러, 출력 토큰당 10달러로 가격을 제시하고 있다. Google Cloud 역시 모델과 처리 방식에 따라 표준, 우선 처리, 배치 처리 가격을 다르게 책정한다. 같은 모델에서도 캐시된 입력은 훨씬 저렴할 수 있다.

가격표만 보면 토큰이 마치 완전히 표준화된 원자재처럼 보인다.

하지만 철강 1톤이나 전력 1kWh와 달리 AI 토큰은 품질이 동일하지 않다.

어떤 모델의 10만 토큰이 다른 모델의 100만 토큰보다 더 좋은 결과를 낼 수 있다. 반대로 더 비싼 모델이 필요 이상으로 긴 reasoning을 수행해 비용만 높일 수도 있다.

OpenAI 역시 공식 문서에서 100만 토큰당 명목 가격만 보고 모델을 비교해서는 안 된다고 설명한다. 모델마다 토큰화 방식, 생성량, reasoning 사용량이 다르기 때문에 실제 대표 업무를 끝내는 총비용을 측정해야 한다는 것이다.

이 지점부터 토큰은 석유처럼 단순한 상품이 아니라 ‘서로 다른 생산성을 가진 컴퓨팅 단위’가 된다.

진짜 단위는 ‘토큰당 비용’이 아니라 ‘결과당 비용’이다

기업이 AI를 구매하는 이유를 생각하면 답은 더 명확해진다.

기업은 토큰을 소비하고 싶어서 AI를 도입하지 않는다.

고객지원 티켓을 더 싸게 처리하고 싶다. 소프트웨어 개발 시간을 줄이고 싶다. 영업 담당자의 생산성을 높이고 싶다. 계약서 검토 시간을 단축하고 싶다. 보안 사고를 더 빨리 탐지하고 싶다.

그래서 AI의 진짜 경제적 단위는 결국 토큰이 아니라 ‘완료된 업무’가 된다.

Microsoft는 최근 이를 ‘cost-to-outcome curve’라는 표현으로 설명한다.

회사는 자체 MAI 모델을 실리콘과 공동설계하고 있으며, Maia 200에서 MAI 모델을 실행할 때 성능/W가 40% 개선됐다고 밝혔다. 하지만 더 중요한 목표는 단순한 토큰 가격 인하가 아니라 업무 결과 하나를 만드는 데 필요한 총비용을 낮추는 것이라고 설명한다.

실제 사례도 흥미롭다.

Microsoft에 따르면 GitHub Copilot에서 사용된 MAI-Code-1-Flash는 더 높은 코드 수용률을 보이면서 중앙값 기준 토큰 사용량을 10% 줄였다. Excel의 일반적인 작업에서는 GPT-5.6과 비슷한 품질을 더 낮은 비용으로 제공한다고 회사는 설명했다.

여기서 AI 경제의 경쟁 기준이 보인다.

A 모델은 토큰당 1달러지만 업무를 끝내는 데 1,000만 토큰이 필요하다. B 모델은 토큰당 3달러지만 100만 토큰으로 끝낸다.

표면적으로는 A가 싸다. 실제 업무비용은 B가 훨씬 낮다.

그래서 앞으로 기업 AI의 가격 경쟁은 ‘100만 토큰당 몇 달러’에서 ‘고객지원 한 건, 코드 수정 한 건, 계약 검토 한 건을 얼마에 끝내느냐’로 이동할 가능성이 높다.

Agent 시대에는 비용 통제가 소프트웨어 기능이 된다

Agent가 널리 보급되면 새로운 문제가 생긴다.

AI가 스스로 너무 많은 돈을 쓸 수 있다는 점이다.

사람이 챗봇을 사용할 때는 비용을 어느 정도 예측할 수 있다. 하지만 Agent는 문제가 풀리지 않으면 다시 검색하고, 도구를 재호출하고, 다른 Agent에게 업무를 넘기고, reasoning을 반복할 수 있다.

Microsoft는 2026년 8월 공개한 TokenOps 관련 글에서 한 Agent 실행이 수백 번의 모델 호출을 발생시킬 수 있다고 설명한다. 개별 호출은 싸 보여도 전체 실행 비용을 합치면 업무 자체의 가치보다 더 많은 토큰을 소비하는 상황이 생길 수 있다는 것이다.

이것은 기업 소프트웨어에 새로운 관리 계층을 만든다.

앞으로 Agent에는 단순히 권한관리만 필요한 것이 아니다.

업무 한 건당 예산. 최대 모델 호출 횟수. 최대 reasoning 시간. 모델별 비용 상한. 실패 시 재시도 횟수. 캐시 활용률. 업무 가치 대비 비용.

이런 제어가 필요해진다.

사람에게 출장비 규정과 구매 한도가 있듯, AI Agent에도 계산 예산이 생기는 셈이다.

이 변화는 AI 플랫폼 경쟁에서도 중요하다. 기업은 가장 똑똑한 Agent만 찾지 않는다. 비용이 예측 가능하고, 과도한 연산을 막을 수 있으며, 실패 원인을 추적할 수 있는 Agent를 원하게 된다.

토큰 가격 하락은 AI 산업의 위기가 아니라 시장 확대의 조건일 수 있다

AI 투자자 입장에서는 토큰 가격 하락을 두 가지로 해석할 수 있다.

첫 번째 해석은 디플레이션이다.

모델 경쟁이 심해지고 추론칩이 좋아지면서 토큰 가격이 계속 내려간다. 그렇다면 AI 회사의 매출과 마진이 압박받을 수 있다.

두 번째 해석은 시장 확대다.

토큰 가격이 내려가면서 이전에는 경제성이 없던 업무들이 AI로 넘어온다. 더 많은 기업이 Agent를 배치하고, 기존 사용자는 더 자주 AI를 호출한다. 단가는 떨어져도 수량이 훨씬 빠르게 늘어난다.

어느 쪽이 더 강한지가 앞으로 AI 산업의 이익 규모를 결정한다.

이 때문에 AI 기업을 볼 때 단순한 ‘토큰 가격’만 확인해서는 안 된다.

토큰 단가 하락률보다 사용량 증가율이 빠른가. 추론 비용 하락이 고객 가격 인하보다 빠른가. 모델 전환으로 gross margin이 좋아지는가. Agent 한 건당 총 토큰 사용량은 어떻게 변하는가. 캐시와 배치 처리로 실제 원가가 얼마나 내려가는가.

이 숫자가 중요하다.

토큰은 싸질 가능성이 높다. 하지만 지능의 총소비량은 그보다 훨씬 빠르게 커질 수 있다.

AI에서 가장 큰 시장은 ‘질문’이 아니라 ‘업무’일 수 있다

지금까지 생성형 AI 시장은 주로 사람의 질문으로 측정됐다.

몇 명이 ChatGPT를 사용하는가. 몇 번 검색하는가. 얼마나 많은 코드를 생성하는가.

Agent 시대에는 시장 단위가 달라질 수 있다.

한 사람이 하루에 AI에게 질문 20번을 하는 대신, 50개의 Agent가 밤새 고객 데이터, 코드, 보안로그, 재고, 영업자료를 처리할 수 있다.

인간의 시간은 하루 24시간으로 제한된다.

소프트웨어 Agent의 작업시간은 그런 제약을 받지 않는다.

이것이 추론 시장의 잠재력이 학습 시장보다 훨씬 클 수 있는 이유다.

인간의 질문 수에는 자연스러운 상한이 있다. 하지만 기업이 자동화할 수 있는 업무량에는 훨씬 높은 상한이 있다.

결국 AI 산업에서 가장 큰 수요처는 ‘사람이 AI에게 질문하는 시간’이 아니라 ‘기업이 기계에게 넘기는 업무의 총량’이 될 가능성이 있다.

토큰은 그 업무를 처리하기 위해 소비되는 계산 단위다.

이 관점으로 보면 Agent는 단순한 새로운 AI 제품이 아니다. AI 컴퓨팅 수요의 단위를 사람의 클릭에서 기업의 업무 프로세스로 바꾸는 전환점이다.

토큰이 산업재가 된다는 말의 진짜 의미

토큰이 철강이나 전력처럼 완전히 표준화된 상품이 된다는 뜻은 아니다.

오히려 중요한 것은 다른 데 있다.

AI가 산업으로 성숙할수록 ‘얼마나 많은 지능을 생산했고, 그 지능을 얼마의 비용으로 공급했으며, 그것이 얼마의 경제적 결과를 만들었는가’를 측정해야 한다는 뜻이다.

NVIDIA는 토큰/초와 토큰/W를 본다. 클라우드 사업자는 토큰당 추론비와 가동률을 본다. 모델 회사는 입력·출력·캐시 토큰 가격을 설계한다. 기업 고객은 업무 한 건당 AI 비용을 계산한다. 투자자는 그 모든 비용이 최종 매출과 현금흐름으로 돌아오는지 본다.

이 연결고리가 완성될수록 AI는 소프트웨어 기능이 아니라 생산요소에 가까워진다.

그리고 이 순간부터 ‘가장 똑똑한 모델’이라는 질문만으로는 산업을 설명할 수 없게 된다.

더 중요한 질문은 이것이다.

같은 1달러의 전력과 같은 1달러의 컴퓨팅을 넣었을 때 누가 더 많은 유용한 지능을 생산하는가.

그리고 그 지능이 고객에게 1달러보다 훨씬 큰 경제적 가치를 만들어주는가.

AI의 다음 경쟁은 바로 이 생산성 방정식 위에서 벌어질 가능성이 높다.

INSIGHT TIMES VIEW

토큰은 AI 경제의 중요한 생산 단위가 되고 있지만, 투자자가 토큰 수 자체에 매달리면 오히려 본질을 놓칠 수 있다. 궁극적으로 중요한 것은 ‘유용한 결과당 비용’이다.

2026년의 가장 강한 Signal은 Agent가 토큰 소비 구조를 바꾸고 있다는 점이다. 단순 챗봇은 한 번의 요청과 한 번의 응답으로 끝나지만 Agent는 검색·도구 호출·재시도·검증을 반복한다. 이 구조가 기업 업무에 널리 배치되면 토큰 단가 하락보다 총 토큰 소비량 증가가 더 빨라지는 AI판 제번스 역설이 현실화될 수 있다.

다만 총 토큰 소비량이 폭증해도 모델 공급자의 마진이 반드시 좋아지는 것은 아니다. 모델 가격 경쟁, 자체 ASIC, 오픈소스 모델, 캐시·배치 최적화가 토큰당 수익을 빠르게 떨어뜨릴 수 있다. 따라서 산업 성장과 개별 기업의 이익 성장은 분리해서 봐야 한다.

토큰은 정확히 무엇인가?
  • 모델이 텍스트나 기타 입력을 처리하기 위해 나누는 기본 계산 단위다. 입력 토큰, 출력 토큰, 캐시된 입력 토큰, reasoning 토큰 등 종류에 따라 비용이 달라질 수 있다.
왜 토큰을 전기나 석유 같은 산업재에 비유하나?
  • AI 인프라가 토큰을 대규모로 생산하고 기업이 이를 업무에 소비한다는 점에서는 산업재와 비슷하다. 다만 모델마다 토큰의 품질과 생산성이 달라 완전히 표준화된 원자재는 아니다.
토큰 가격이 떨어지면 NVIDIA 같은 인프라 기업에는 악재 아닌가?
  • 반드시 그렇지는 않다. 단가 하락보다 사용량 증가가 빠르면 전체 추론 수요는 더 커질 수 있다. 반대로 효율 향상이 사용량 증가를 압도하면 인프라 수요가 둔화할 수 있으므로 실제 총 컴퓨팅 소비를 봐야 한다.
Agent는 왜 그렇게 많은 토큰을 쓰나?
  • 한 번 답하고 끝나는 것이 아니라 검색, 도구 사용, 문서 읽기, reasoning, 재시도, 검증을 반복하기 때문이다. Microsoft Research는 일부 Agent 코딩 과제가 일반 코드 채팅보다 최대 1,000배 많은 토큰을 소비할 수 있다고 보고했다.
AI 회사의 진짜 경쟁력은 무엇으로 측정해야 하나?
  • 모델 벤치마크만으로는 부족하다. 같은 업무를 얼마나 적은 비용과 시간으로 정확하게 완료하는지, 즉 cost-to-outcome과 고객 ROI를 함께 봐야 한다.

체크 포인트

Agent 업무당 총 토큰 사용량한 번의 Agent 실행에서 모델 호출 횟수와 입력·출력 토큰이 얼마나 늘어나는지 확인해야 한다. 이것이 추론 수요의 진짜 레버리지다.
100만 토큰당 가격보다 cost-to-outcome코드 수정 한 건, 고객지원 티켓 한 건, 리서치 작업 한 건을 끝내는 실제 총비용이 내려가는지를 본다.
캐시 비중반복되는 긴 컨텍스트를 캐시에 넣으면 입력 토큰 원가가 크게 낮아질 수 있다. Agent 경제성의 핵심 변수다.
추론 성능/W같은 전력으로 더 많은 유용한 토큰을 생성할수록 데이터센터의 매출 생산성이 높아진다.
Agent 재시도·실패율토큰을 많이 쓰고도 결과 품질이 개선되지 않는다면 비용 효율이 급격히 악화된다.
값싼 토큰은 총지출을 줄이지 않는다. 무엇을 끝내는 데 얼마가 드는지가 남는다.

출처

  • NVIDIA, AI Factories: The New Infrastructure of Intelligence
  • NVIDIA, Unlocks AI Compute at Scale
  • Microsoft FY2026 Q4 Earnings Call
  • Microsoft Research, How Do AI Agents Spend Your Money?
  • OpenAI, Understanding and counting tokens
  • Anthropic, Claude Sonnet 5
  • Google Cloud, Agent Platform Pricing

인사이트 타임스 편집부

AI 사용 고지
이 기사는 사람 편집자가 기획하고, 사람과 AI가 같이 초안을 쓰고 수정하고, 최종 사람 편집자가 사실과 표현을 확인해 발행했습니다. 수치와 인용은 본문에 적힌 자료에서 가져왔습니다.