AI가 전기를 가장 많이 먹는 순간은 ‘공부할 때’가 아닐 수도 있다
Anthropic이 호주에서 확보한 것은 차세대 Claude를 훈련할 연구소가 아니라, 이미 만들어진 Claude를 사람들이 실제로 사용할 때 필요한 추론 인프라다. 2.16GW급 캠퍼스가 던지는 질문은 분명하다. AI의 전력 수요를 결정하는 변수가 ‘모델을 얼마나 자주 새로 만드는가’에서 ‘AI를 얼마나 많이, 오래 사용하는가’로 옮겨갈 수 있다는 것이다.
20초 핵심
원전 두 기급 전력, 그런데 ‘공부’가 아니라 ‘일’에 쓴다
2.16GW는 숫자만 보면 감이 잘 오지 않는다. 1GW급 대형 원전 두 기의 정격 발전용량을 조금 넘는 수준이다. 이 전력을 24시간 365일 모두 사용한다고 단순 가정하면 이론적 최대 소비량은 연간 약 18.9TWh다. 실제 사용량은 가동률과 단계별 증설, 전력 효율에 따라 달라진다.
ABC는 Western Downs Digital Park가 완성 단계에서 하루 약 47GWh를 사용할 수 있으며, Queensland의 현재 평균 일일 전력 소비량 170GWh와 비교하면 매우 큰 부하라고 전했다. 이 프로젝트 자체가 아직 제안 단계이고 건설에는 수년이 걸릴 수 있다는 점도 함께 봐야 한다.
그런데 전력 규모보다 더 중요한 단어는 inference다. Training은 AI가 문제를 푸는 법을 배우는 과정이다. Inference는 이미 학습한 모델이 실제 고객의 요청을 받아 답을 만드는 과정이다. 쉽게 말하면 training이 ‘공부’라면 inference는 ‘출근해서 일을 하는 시간’이다.
Netflix보다 더 무거운 스트리밍
영화 한 편을 만드는 데 2억달러가 들어갔다고 생각해보자. 제작 과정은 training과 비슷하다. 완성된 영화를 전 세계 수억 명에게 계속 스트리밍하려면 CDN과 서버가 필요하다. 이것이 inference에 가깝다.
다만 AI는 Netflix보다 계산이 훨씬 무겁다. Netflix는 이미 만들어진 영상 파일을 전달하지만, 생성형 AI는 질문이 들어올 때마다 새로운 토큰을 계산한다. reasoning model은 답하기 전에 더 긴 내부 계산을 수행하고, Agent는 계획을 세우고 검색하고 코드를 실행하고 결과를 확인하고 실패하면 다시 시도한다.
사용자에게는 한 번의 요청처럼 보여도 데이터센터에서는 여러 차례의 model call이 이어질 수 있다. IEA도 2026년 보고서에서 reasoning과 agentic task 같은 새로운 AI 사용 방식은 단순한 텍스트 생성보다 한 요청당 에너지 사용량이 수백 배에서 수천 배까지 커질 수 있다고 지적했다. 동시에 모델과 하드웨어 효율도 빠르게 개선되고 있어, 최종 전력 수요는 ‘요청당 효율 개선’과 ‘사용량 폭증’ 중 어느 쪽이 더 빠른지에 달려 있다.
AI Compute의 공식이 바뀌고 있다
생성형 AI 초기에는 투자자의 시선이 training에 집중됐다. 더 큰 모델, 더 많은 GPU, 더 긴 학습 시간이 곧 AI 인프라 투자였다.
하지만 서비스가 대중화되면 경제 구조가 달라진다. Training은 매우 비싸지만 특정 시점에 집중되는 작업이다. Inference는 고객이 사용할 때마다 발생한다. 사용자 수가 늘고, 질문이 길어지고, Agent가 한 요청을 여러 단계로 쪼개면 총 연산량은 누적된다.
Training 중심
Training + Inference
대규모 Inference + Agentic Workloads
그래서 AI compute의 중심축은 ‘Training 중심’에서 ‘Training + 대규모 Inference’, 더 나아가 ‘상시 Agentic Workload’로 이동할 가능성이 있다. Anthropic의 호주 계약은 inference가 단순한 부가 작업이 아니라 GW 단위의 전력 인프라를 미리 확보해야 하는 사업으로 변하고 있음을 보여주는 초기 신호다.
다만 이것만으로 inference가 이미 training보다 더 많은 전력을 쓴다고 결론내릴 수는 없다. Anthropic은 시설별 실제 GPU 수, 가동률, 전력 사용량, training과 inference의 전체 compute 비중을 공개하지 않았다. 이번 뉴스가 보여주는 것은 ‘역전이 이미 일어났다’가 아니라 ‘역전을 상정한 인프라 투자가 시작되고 있다’는 쪽에 가깝다.
Nvidia 투자자에게는 TAM 확대이자 경쟁 방식의 변화
이 변화는 Nvidia에 우호적이면서도 까다롭다. Inference가 폭발하면 GPU와 네트워킹, HBM, 전력 및 냉각 인프라의 총주소가능시장(TAM)은 커질 수 있다. 하지만 고객이 중요하게 보는 기준도 바뀐다.
Training에서는 최고 성능과 대규모 클러스터 확장성이 우선이었다. Inference에서는 token per dollar, token per watt, latency, utilization이 수익성을 좌우한다. Nvidia가 2026년 Blackwell Ultra를 설명하면서 전면에 내세우는 지표도 ‘GPU 한 개가 얼마나 빠른가’보다 ‘메가와트당 얼마나 많은 토큰을 생성하는가’와 ‘토큰당 비용’이다.
바로 이 지점에서 경쟁이 더 거세진다. Google TPU, Amazon Trainium 계열 같은 custom silicon과 AMD 가속기는 모든 워크로드에서 Nvidia를 이길 필요가 없다. 특정 모델을 충분히 싸고 효율적으로 서비스할 수 있다면 inference 시장의 일부를 가져갈 수 있다. 따라서 inference의 확대는 Nvidia의 시장을 넓히지만, 동시에 ‘가장 빠른 칩’만으로는 충분하지 않은 시장을 만든다.
이번 뉴스에서 가장 흥미로운 숫자는 2.16GW가 아니라 그 전력의 용도다.
최근 AI 개발 속도 조절론을 보면서 일부 투자자는 ‘frontier model을 덜 자주 만들면 GPU 수요도 둔화되는 것 아닌가’라고 생각할 수 있다. 그 논리는 training만 보면 맞을 수 있다. 그러나 AI 산업이 소비 단계로 넘어가면 다른 변수가 더 커진다.
모델을 1년에 두 번 새로 만들지 네 번 새로 만드는지보다, 매일 몇 명이 AI를 쓰는지, 한 사람이 몇 개의 Agent를 돌리는지, 한 요청이 몇 개의 토큰과 model call을 발생시키는지가 더 중요해질 수 있다.
이 관점에서는 AI 인프라 투자의 핵심 질문도 달라진다. ‘다음 모델이 얼마나 큰가’만 볼 것이 아니라 ‘이미 만들어진 지능이 얼마나 많이 소비되는가’를 봐야 한다.
다만 전력 수요를 직선으로 외삽해서는 안 된다. 칩 효율, 양자화, speculative decoding, 모델 경량화, 캐싱 같은 기술이 inference 비용을 빠르게 낮추고 있다. IEA도 AI 전력 수요가 효율 개선과 사용량 증가가 동시에 작동하는 불확실한 함수라고 강조한다. 투자자에게 필요한 태도는 전력폭발을 확신하는 것이 아니라, 사용량 증가가 효율 개선을 계속 앞서는지를 확인하는 것이다.
- 아직 확인되지 않았다. 앤스로픽은 시설별 전력 사용량과 학습·추론 비중을 공개하지 않았다.
- 다만 추론을 상정한 GW 단위 전력 계약이 먼저 나오고 있다는 것까지는 사실이다.
- 이미 학습한 모델이 고객 요청을 받아 답을 만드는 과정이다.
- 학습이 공부라면 추론은 출근해서 일하는 시간에 가깝다.
- 1GW급 대형 원전 두 기의 정격 발전용량을 조금 넘는 수준이다.
- 24시간 내내 다 쓴다고 단순 가정하면 연간 약 18.9TWh다. 실제 사용량은 가동률과 증설 단계에 따라 달라진다.
- 추론이 늘면 GPU와 네트워킹, HBM, 전력·냉각 설비의 시장 자체는 커질 수 있다.
- 다만 고객이 보는 기준이 최고 성능에서 토큰당 비용과 와트당 토큰으로 옮겨간다.
- 구글 TPU나 아마존 트레이니엄 같은 자체 칩이 일부를 가져갈 여지도 생긴다.
- 프로젝트는 아직 제안 단계이고 건설에 수년이 걸릴 수 있다.
- 호주 외국인투자심의위원회 심사와 현지 개발 절차도 남아 있다.
체크 포인트
인사이트 타임스 편집부





