지능은 2달러로 내려가는데, 메모리는 87% 마진을 찍었다

AI의 경제학이 뒤집히고 있다. 프런티어급 모델의 API 가격은 100만 입력 토큰당 2달러로 수렴하는데, 이를 돌리는 메모리와 컨텍스트 저장장치는 오히려 병목이 되고 있다. 투자자가 봐야 할 것은 ‘AI가 얼마나 똑똑해졌나’보다 ‘AI 사용량이 늘수록 무엇이 더 희소해지는가’다.

20초 핵심

1
지능 가격의 압축. Gemini 4 Argon, GPT-6 Sol, Claude Sonnet 5.5의 표준 또는 도입 가격이 모두 100만 입력 토큰당 2달러, 출력 10달러로 수렴. 다만 GPT-6 Sol은 OpenAI의 절대 최상위 Astra보다 한 단계 아래라는 점은 구분할 필요.
2
메모리는 반대 방향. Micron의 FY4Q26 비GAAP 매출총이익률은 87.0%. 다음 분기 매출 가이던스는 615억달러 ± 15억달러. 장기공급계약 관련 고객 금융약정은 320억달러, 잔여 수행의무는 약 1,500억달러까지 확대.
3
투자 기준의 이동. 토큰당 가격만으로는 AI 경제성을 설명하기 어려운 단계. 에이전트가 더 긴 컨텍스트를 더 오래 유지할수록 실제 병목은 HBM, 서버 DRAM, KV 캐시용 SSD, 전력과 네트워크로 이동할 가능성.

프런티어 AI의 ‘2달러 수렴’

9월 22일 OpenAI는 GPT-6 Sol을 100만 입력 토큰당 2달러, 출력 10달러에 출시했다. 9월 28일 Anthropic의 Claude Sonnet 5.5도 같은 가격을 제시했고, 9월 30일 Google의 Gemini 4 Argon 역시 도입 가격을 2달러와 10달러로 맞췄다.

중요한 것은 가격만 내려간 것이 아니라는 점이다. Google에 따르면 Argon은 장기 소프트웨어 엔지니어링 평가 DeepSWE v1.1에서 77.9%, Zapier AutomationBench에서 51.3%로 1위를 기록했고 최대 출력 한도를 100만 토큰으로 확대했다. Anthropic은 Sonnet 5.5가 이전 세대와 같은 토큰 단가이면서도 동일 과업에 필요한 토큰을 줄여 작업당 비용을 최대 30% 낮춘다고 설명한다.

AI 가격 경쟁의 단위가 ‘토큰당 얼마인가’에서 ‘업무 한 건을 끝내는 데 얼마가 드는가’로 이동하고 있다.

Epoch AI가 같은 수준의 성능을 얻는 비용을 추적한 결과, 2023년 이후 하락 속도는 분기당 약 47%, 연율로는 약 13배였다. 지능의 단가가 빠르게 떨어지는 방향 자체는 이제 일시적 프로모션이라기보다 구조적 추세에 가깝다.

그런데 같은 날, Micron은 87%의 총마진을 기록했다

소프트웨어 레이어의 가격은 내려가지만 물리적 인프라는 정반대다. Micron의 2026 회계연도 4분기 매출은 542억2,900만달러로 전년 동기 113억1,500만달러의 약 4.8배. 비GAAP EPS는 33.42달러, 비GAAP 매출총이익률은 87.0%였다.

$54.23BFY4Q26 매출, 전년 동기 대비 약 +379%
87.0%
FY4Q26 비GAAP 매출총이익률
$61.5BFY1Q27 매출 가이던스 중앙값

더 눈에 띄는 숫자는 계약이다. Reuters에 따르면 장기공급계약에 대한 고객의 금융약정은 6월 220억달러에서 320억달러로 늘었고, 대부분 현금 예치금 형태다. Micron의 잔여 수행의무는 약 1,500억달러로 증가했다. 회사는 2027~2028 회계연도의 메모리와 스토리지 수급이 2026년보다 더 타이트할 것으로 보고 있으며, 2027년 HBM 생산량의 대부분에 대해 이미 계약을 확보했다고 밝혔다.

다만 이 숫자를 곧바로 “메모리 사이클이 사라졌다”로 번역하면 위험하다. 장기계약은 매출 가시성을 높이고 공급자의 협상력을 강화하지만, 고객의 CapEx 조정이나 기술 전환, 공급 증설에 따른 다운사이클 가능성까지 제거하지는 못한다.

제번스의 역설 : AI가 싸질수록 인프라는 더 많이 필요할 수 있다

핵심 메커니즘은 단순하다. 지능이 싸지면 같은 예산으로 더 많은 호출을 할 수 있다. 챗봇 한 번의 답변이 아니라, 에이전트가 계획하고 검색하고 코드를 실행하고 실패를 수정하는 루프를 반복하면 과업당 토큰 소비량은 크게 늘어난다.

따라서 토큰 가격이 절반으로 내려가도 사용량이 두 배 이상 늘면 전체 인프라 수요는 줄지 않는다. 효율 개선이 오히려 총소비를 늘리는 제번스의 역설이 AI에서도 나타날 수 있는 이유다. 다만 이것은 경제적 가설이지 자동으로 성립하는 법칙은 아니다. AI 사용량 증가가 가격 하락 속도를 얼마나 앞지르는지가 실제 결과를 결정한다.

다음 병목은 HBM만이 아니다 : KV 캐시와 SSD

긴 컨텍스트와 멀티턴 에이전트가 늘면 GPU는 계산만 하는 것이 아니라 이전 문맥을 계속 보존해야 한다. 이때 쓰이는 것이 KV 캐시다. KV 캐시 크기는 모델 구조, 정밀도, KV 헤드 수에 따라 크게 달라지므로 “100만 토큰은 항상 320GB”라고 말할 수는 없다. 다만 연구 사례에서 Llama 3 70B의 100만 토큰 컨텍스트는 약 320GB의 KV 캐시를 필요로 하는 것으로 계산됐다. 단일 H100 80GB를 크게 넘어서는 크기다.

이 문제 때문에 컨텍스트를 HBM에만 붙잡아 두기보다 CPU DRAM과 플래시 스토리지로 계층화하는 구조가 부상하고 있다. NVIDIA는 BlueField-4 기반 CMX를 GPU 메모리를 확장하는 공유 컨텍스트 계층으로 제시하며, 기존 스토리지 대비 최대 5배의 처리량과 전력 효율 개선을 주장한다.

흥미로운 것은 Micron의 실적 자료다. 회사는 PCIe Gen 5 7600 SSD와 Gen 6 9650 SSD가 이미 KV-cache 애플리케이션용으로 주요 고객에게 출하되고 있다고 밝혔다. ‘AI 메모리’의 투자 지도가 HBM에서 서버 DRAM과 엔터프라이즈 SSD까지 넓어질 수 있음을 보여주는 실제 상업화 신호다.

가치사슬에서 누가 유리한가

계층긍정 요인핵심 리스크
메모리 · 스토리지HBM 부족, 장기계약 확대, KV 캐시용 서버 DRAM·SSD 수요가격 급등이 고객 최적화와 증설을 촉진할 가능성
클라우드 · 빅테크저렴한 모델 가격이 사용량 확대와 클라우드 트래픽 증가를 유도메모리·전력·네트워크 비용 상승으로 추론 마진 압박
버티컬 AI원재료인 모델 비용 하락, 업무 결과 기준의 고부가가치 과금 가능파운데이션 모델의 기능 확장과 번들링 위험
범용 모델 사업자규모의 경제와 사용량 확대가격 경쟁 심화, 차별화가 약하면 토큰당 마진 압축
INSIGHT TIMES VIEW

이번 변화의 핵심은 “AI 모델 기업은 나쁘고 메모리 기업은 좋다”가 아니다. 가치가 이동하는 지점을 봐야 한다.

모델 자체의 지능은 빠르게 범용화되고 가격이 떨어진다. 반면 사용량이 늘수록 반드시 더 필요해지는 물리적 자원과, 그 지능을 실제 기업 업무의 성과로 바꾸는 워크플로우는 상대적으로 희소해질 수 있다.

따라서 투자자는 ‘AI를 사느냐 마느냐’보다 병목의 가격결정력이 얼마나 오래 지속되는지를 봐야 한다. Micron의 87% 총마진과 320억달러 고객 약정은 강력한 신호지만, 영구적인 정상상태라고 단정할 수는 없다.

실제로 강한 실적 발표 뒤에도 주가 반응이 제한적이었던 것은 시장이 이미 높은 실적보다 그 지속기간을 묻고 있다는 뜻에 가깝다.

또 하나의 제한조건은 전력이다. Reuters에 따르면 Oracle은 뉴멕시코의 Jupiter 데이터센터가 전력 확보 지연을 겪자 불가항력 조항을 발동했다.

칩과 메모리가 있어도 발전소와 송전망이 늦으면 설치된 자본은 수익을 내지 못한다. AI의 다음 단계는 모델 경쟁만이 아니라 메모리, 스토리지, 전력망을 함께 최적화하는 산업 경쟁이다.

프런티어 AI 가격이 모두 2달러라는 뜻인가?
  • 아니다. 2달러는 현재 주요 고성능 실용 모델의 입력 가격이 수렴한 수준이다. OpenAI의 최상위 GPT-6 Astra는 이보다 비싸다. 따라서 “최고 지능 전체가 2달러”가 아니라 “프런티어급 실용 모델의 가격 기준선이 2달러까지 내려왔다”가 더 정확하다.
메모리 가격이 계속 오르면 메모리 기업에는 무조건 좋은가?
  • 단기적으로는 매출과 마진에 유리하다. 그러나 가격이 지나치게 높아지면 고객이 모델 경량화, 캐시 최적화, HBM 사용량 절감, 자체 가속기 채택을 서두를 수 있다. 장기적으로는 적정한 부족이 공급자에게 가장 유리한 구조다.
KV 캐시 때문에 NAND가 HBM만큼 중요해진다고 볼 수 있나?
  • 아직 그렇게 단정하기는 이르다. HBM은 실시간 연산에 필수이고 SSD는 더 느린 계층이다. 다만 장기 컨텍스트를 재사용하고 HBM 용량을 보완하는 컨텍스트 저장계층이 상업화되면서 엔터프라이즈 SSD의 AI 노출도가 높아지는 것은 확인할 수 있다.
이 논지가 틀릴 수 있는 가장 중요한 조건은?
  • AI 사용량 증가가 모델 단가 하락과 효율 개선을 따라가지 못하는 경우다. 여기에 데이터센터 전력 지연이나 기업 AI의 ROI 부진까지 겹치면 하드웨어 수요가 예상보다 빨리 둔화될 수 있다.

체크 포인트

Micron 비GAAP 총마진FY1Q27 가이던스는 약 86.25%. 80%대 중후반이 지속되면 공급자 가격결정력 논리가 강화되고, 빠르게 하락하면 피크아웃 논리가 힘을 얻는 지표. 장기계약 금융약정과 RPO 현재 고객 금융약정 320억달러, RPO 약 1,500억달러. 증가세가 유지되는지가 수요 가시성의 핵심. HBM 외 SSD 매출 KV 캐시용 엔터프라이즈 SSD 출하가 실제 매출 비중 확대로 이어지는지 확인. HBM에서 스토리지로 수혜가 확산되는지를 가르는 지표. AI 작업당 비용 토큰 단가보다 에이전트의 과업 성공률, 총토큰 사용량, 캐시 적중률을 함께 관찰. 가격 하락보다 사용량 증가가 더 빠른지가 핵심. 전력 확보와 데이터센터 가동 지연 GW급 프로젝트의 전력 인입 일정, 불가항력 조항, 완공 지연 여부. 하드웨어 주문이 실제 가동 수요로 연결되는 속도를 결정.
AI 값은 내려가는데, 그 AI를 돌리는 메모리는 지금 아주 비싸게 팔리고 있다.

인사이트 타임스 편집부