최고 지능은 $2로 수렴했다: AI 가격 붕괴가 메모리·SSD의 희소성을 키우는 역설

구글, 오픈AI, 앤트로픽의 주력 모델 가격이 100만 입력 토큰당 2달러로 수렴했다. 그런데 같은 시기 마이크론은 87%의 비GAAP 매출총이익률을 기록했다. AI 경제의 핵심은 이제 ‘토큰 가격’보다 ‘작업당 비용’, 그리고 그 작업량이 어떤 물리 자원을 고갈시키는지에 있다.

20초 핵심

1
Gemini 4 Argon, GPT-6 Sol, Claude Sonnet 5.5의 공식 API 가격이 모두 100만 입력 토큰당 2달러, 출력 10달러 수준으로 수렴. 성능 경쟁이 끝난 것이 아니라 최고급 지능의 가격 프리미엄이 빠르게 축소되는 흐름.
2
반대편에서는 마이크론 FY4Q26 매출 542.3억달러, 비GAAP 총마진 87.0%, 다음 분기 매출 가이던스 615억달러 ± 15억달러. 소프트웨어 지능은 싸지지만 메모리 공급의 희소성은 오히려 커지는 모습.
3
투자자의 질문도 변경 필요. “토큰이 얼마나 싼가”보다 “업무 한 건을 끝내는 총비용과 성공률”, “사용량 증가가 효율 개선을 얼마나 초과하는가”, “병목이 HBM에서 DRAM, SSD, 전력까지 어디로 이동하는가”가 더 중요한 판단 기준.

최상위 모델의 가격표가 같은 숫자를 가리키기 시작했다

구글은 9월 30일 Gemini 4 Argon을 100만 입력 토큰당 2달러, 출력 10달러의 도입 가격으로 공개했다. 오픈AI의 GPT-6 Sol과 앤트로픽의 Claude Sonnet 5.5도 같은 가격이다. Argon은 Google이 공개한 DeepSWE v1.1에서 77.9%, AutomationBench에서 51.3%를 기록했다. 즉 이번 가격 하락을 단순한 저성능 모델의 할인으로 보기는 어렵다.

더 큰 흐름도 같다. Epoch AI는 동일한 수준의 성능을 얻는 실제 비용이 2023년 이후 분기당 약 47%, 연율로는 약 13배씩 하락했다고 추정한다. Silicon Data의 광범위 LLM 토큰 지출 지수도 9월 24일 기준 100만 토큰당 0.96달러까지 내려왔다. ‘지능 디플레이션’은 마케팅 문구보다 넓은 시장 데이터에서 확인되는 현상이다.

FRONTIER API
$2 / $10
100만 입력 / 출력 토큰당 가격
EPOCH AI
약 13배/년
동일 성능 달성 비용의 연간 하락 속도 추정
$0.96
SILICON DATA
9월 24일 광범위 시장 100만 토큰 지출 지수

그런데 마이크론의 총마진은 87%다

같은 날 마이크론이 발표한 FY4Q26 실적은 정반대의 가격 신호를 보여줬다. 매출은 542.29억달러로 전년 동기 113.15억달러보다 379% 늘었고, 비GAAP EPS는 33.42달러, 비GAAP 매출총이익률은 87.0%였다. 다음 분기 가이던스는 매출 615억달러 ± 15억달러, 비GAAP EPS 38.15달러 ± 1달러, 비GAAP 총마진 약 86.25%다.

더 중요한 숫자는 계약이다. 마이크론의 장기 전략 고객계약은 26건으로 늘었고, 시장이 인용한 잔여 계약가치는 약 1,500억달러다. 고객의 현금예치금과 관련 금융약정도 6월 220억달러에서 320억달러로 늘었다. 과거처럼 모든 물량이 짧은 주기로 가격 재협상되는 구조에서, 일부 수요가 장기 계약으로 잠기는 방향으로 이동하고 있다는 뜻이다.

다만 여기서 “메모리 사이클이 사라졌다”고 결론 내리면 과도하다. 87% 총마진은 공급 부족이 극심하다는 증거인 동시에, 고객이 더 강한 최적화와 공급 다변화를 시도할 유인이 커졌다는 뜻이다. 높은 가격이 오래 지속될수록 신규 공급과 대체 기술도 따라온다.

제번스의 역설보다 중요한 것은 ‘작업량 탄력성’

AI 모델 가격이 절반이 됐다고 인프라 수요가 자동으로 두 배가 되는 것은 아니다. 핵심은 가격 하락으로 새롭게 생기는 작업량이 모델 효율 개선과 하드웨어 성능 향상을 얼마나 초과하느냐다. 그 증가폭이 더 크면 총 컴퓨팅과 메모리 사용량은 오히려 늘어난다.

모델 가격 하락
에이전트 호출 증가
긴 컨텍스트 · 반복 실행
메모리 · 스토리지 · 전력 수요

이 때문에 에이전트 시대의 경제성은 토큰 단가 하나로 설명하기 어렵다. 계획, 검색, 도구 호출, 오류 수정이 반복되는 업무에서는 더 비싼 모델이더라도 적은 반복으로 성공하면 최종 비용이 더 낮을 수 있다. Anthropic이 Sonnet 5.5를 “대부분의 작업에서 최대 30% 저렴하다”고 설명하는 것도 단순 API 가격보다 실제 작업당 비용을 강조한 표현이다.

다음 병목은 HBM만이 아니다

긴 컨텍스트와 장시간 실행되는 에이전트가 늘면 KV 캐시를 GPU HBM에만 계속 보관하기 어렵다. LMCache와 Mooncake 같은 추론 인프라는 KV 캐시를 GPU에서 CPU 메모리, 로컬 SSD, 원격 스토리지로 계층화해 재사용하는 구조를 이미 지원한다. Mooncake의 공개 벤치마크에서는 SSD 오프로딩이 GPU-only 대비 평균 TTFT를 57% 줄이고 입력 처리량을 2.4배 높였다.

마이크론도 FY4Q26 자료에서 자사의 PCIe Gen5·Gen6 SSD가 KV-cache 애플리케이션용으로 주요 고객에게 출하되고 있다고 명시했다. 이는 HBM 수요가 SSD로 대체된다는 뜻이 아니다. HBM은 실시간 연산의 최상위 계층으로 남고, 값싼 대용량 SSD가 오래 유지해야 하는 캐시와 컨텍스트를 맡는 계층화가 진행된다는 의미다.

계층주요 자원역할투자자가 볼 것
Tier 0GPU HBM실시간 어텐션, 활성 토큰 처리HBM 용량, 대역폭, 패키징 공급
Tier 1Host DRAM / CXL빠른 캐시 완충과 스왑서버 DRAM 비트 수요, CXL 채택
Tier 2Enterprise NVMe SSD대용량 KV 캐시 보존과 재사용QLC eSSD 출하량, KV-cache용 SSD 매출
물리 계층전력 · 송전 · 가스 · 부지데이터센터 실제 가동전력 확보 일정과 프로젝트 지연

소프트웨어의 가격 전쟁과 하드웨어의 희소성이 충돌한다

Project Jupiter 사례는 마지막 제약이 칩만이 아니라는 점을 보여준다. Reuters는 Oracle이 뉴멕시코 데이터센터의 전력 확보 지연 가능성을 이유로 force majeure를 통보했다고 보도했다. 다만 Oracle과 STACK은 프로젝트가 계획된 일정대로 진행 중이라고 밝혔다. 현재 확인된 사실은 “전력과 인허가가 대형 AI 프로젝트의 재무 일정까지 흔들 수 있다”는 정도다.

결국 AI 가치사슬에는 서로 반대 방향의 힘이 동시에 작동한다. 모델 사업자는 더 싼 지능을 팔아야 하고, 하이퍼스케일러는 더 많은 요청을 처리해야 하며, 인프라 공급자는 제한된 메모리와 전력의 가격을 높게 유지하려 한다. 이 균형이 깨지는 지점에서 다음 투자 기회와 다음 리스크가 함께 나온다.

INSIGHT TIMES VIEW

지금의 가장 중요한 변화는 “AI 모델의 가치가 사라진다”가 아니라, 가치 측정 단위가 바뀌고 있다는 점이다. 모델 레이어에서는 100만 토큰당 가격 프리미엄이 빠르게 압축되고 있다.

반면 기업 고객은 토큰 자체가 아니라 완성된 업무 결과에 돈을 낸다.

따라서 소프트웨어에서는 높은 작업 성공률과 독점 데이터, 워크플로우 통합력이 해자가 되고, 하드웨어에서는 HBM, 서버 DRAM, 고용량 SSD, 전력처럼 쉽게 늘릴 수 없는 자원이 가격 결정력을 갖는다.

메모리 주식에도 같은 원칙이 필요하다. 마이크론의 낮은 선행 PER만 보고 “구조적 저평가”라고 단정하기보다, 장기계약이 실제로 다운사이클의 마진 저점을 얼마나 끌어올리는지 확인해야 한다. 시장이 의심하는 것은 현재 이익의 크기가 아니라 그 이익의 지속기간이다.

AI 모델 가격은 얼마나 내렸나?
  • 구글 Gemini 4 Argon은 100만 입력 토큰당 2달러, 출력 10달러로 나왔다.
  • 오픈AI GPT-6 Sol과 앤트로픽 Claude Sonnet 5.5도 같은 가격이다.
  • Epoch AI는 같은 성능을 얻는 비용이 2023년 이후 해마다 약 13배씩 내렸다고 추정한다.
AI 값이 내리는데 메모리 회사는 왜 돈을 버나?
  • AI 가격이 내리면 새로 생기는 작업량이 늘어날 수 있다.
  • 그 증가폭이 효율 개선보다 크면 컴퓨팅과 메모리 사용량은 오히려 늘어난다.
  • 마이크론의 87% 총마진은 지금 메모리 공급이 크게 모자라다는 신호로 볼 수 있다.
AI 에이전트가 늘면 SSD 수요가 왜 늘어나나?
  • 긴 문맥을 다루거나 오래 도는 에이전트가 늘면 KV 캐시를 GPU 메모리(HBM)에만 두기 어렵다.
  • LMCache, Mooncake 같은 추론 도구는 이 캐시를 CPU 메모리와 SSD로 나눠 보관한다.
  • 마이크론은 KV 캐시용 PCIe Gen5·Gen6 SSD를 주요 고객에게 출하하고 있다고 밝혔다.
SSD가 HBM을 대체하나?
  • 지금까지의 자료로는 대체보다 역할 분담에 가깝다.
  • HBM은 실시간 연산을 맡는 맨 위 계층으로 남을 가능성이 크다.
  • SSD는 오래 보관할 캐시와 문맥을 맡는 쪽으로 쓰이고 있다.
메모리 사이클은 이제 사라졌나?
  • 그렇게 결론 내리기는 이르다.
  • 높은 가격이 오래 가면 고객이 최적화와 공급처 다변화를 서두를 유인이 커진다.
  • 신규 공급과 대체 기술이 따라올 수 있다는 점도 함께 봐야 한다.

체크 포인트

작업당 비용과 성공률토큰 가격이 더 내려가도 에이전트가 반복 호출을 줄이지 못하면 기업의 실제 비용은 내려가지 않을 수 있음.
마이크론 총마진과 SCA 비중80%대 총마진 유지 여부, 장기계약 매출 비중 확대가 과거 사이클의 이익 변동성을 얼마나 낮추는지 확인.
HBM 외 서버 DRAM · eSSD 성장AI 메모리 수혜가 HBM 한 품목을 넘어 서버 DRAM과 KV-cache용 SSD로 확산되는지 확인.
하이퍼스케일러 CapEx와 AI 매출인프라 비용 상승보다 AI 서비스 매출과 고객 ROI가 빠르게 성장하는지 확인.
전력 확보와 데이터센터 가동 일정칩 구매 발표보다 실제 MW 연결과 상업 가동 시점이 중요. 지연이 늘면 메모리 수요의 인식 시점도 뒤로 밀릴 가능성.
AI 지능이 싸질수록 메모리와 전력은 더 귀해질 수 있다.

인사이트 타임스 편집부