Nvidia보다 느린 칩을 100만 개 연결하면 어떻게 될까
Huawei가 내놓은 답은 더 빠른 칩 하나가 아니다. 최대 100만 개 프로세서를 하나의 컴퓨터처럼 묶는 것이다. 이 시도는 중국의 Nvidia 추격전인 동시에, AI 반도체 경쟁의 진짜 단위가 ‘칩’에서 ‘시스템’으로 이동하고 있음을 보여준다.

20초 핵심

칩 하나가 느리다면, 시스템을 더 크게 만든다
Huawei는 9월 17일 Shanghai의 HUAWEI CONNECT 2026에서 차세대 Ascend 로드맵을 공개했다. Ascend 960DT는 당초 계획보다 세 분기 앞당긴 2027년 1분기, Ascend 960PR은 한 분기 앞당긴 2027년 3분기 출시를 예고했다. Reuters는 Huawei의 중국 내 AI 컴퓨팅 장비 수요가 현재 생산능력을 넘어섰다고 전했다.
하지만 이번 발표에서 더 중요한 숫자는 960이 아니라 1,000,000이다. Huawei가 공개한 Peerium은 중첩 병렬처리, 통합 메모리 주소 체계, 프로세서 간 동등 연결을 통해 최대 100만 프로세서급 시스템을 하나의 거대한 컴퓨터처럼 움직이게 하겠다는 아키텍처다.
여기서 팩트의 경계는 분명해야 한다. 100만 프로세서 시스템이 이미 가동 중이라는 뜻은 아니다. Huawei가 현재 배치 중이라고 공식 확인한 것은 25.6만 카드 규모의 Atlas 950 SuperCluster다. 100만은 Peerium이 지향하는 확장 규모이며, Atlas 960 계열 시스템은 현재 테스트 단계다.
AI의 총성능은 ‘칩 성능 × 개수’가 아니다
대규모 AI 시스템을 직관적으로 이해하려면 다음 식이 더 가깝다.
칩을 10배 늘려도 서로 데이터를 주고받느라 기다리는 시간이 늘면 성능은 10배가 되지 않는다. 학습 과정에서는 수많은 가속기가 매 단계마다 파라미터와 중간 결과를 교환하고 동기화해야 한다. 한쪽이 늦으면 나머지도 기다린다. ‘가장 느린 작업자’가 전체 반복 속도를 결정하는 straggler 문제가 발생한다.
Huawei가 말한 20%가 중요한 이유
Huawei는 이번 행사에서 기존 컴퓨팅 구조로 규모가 커질수록 자원 활용률이 떨어지며, 10만 카드 클러스터의 실제 모델 컴퓨팅 활용률이 약 20%에 불과할 수 있다고 설명했다. 이 수치는 Huawei가 제시한 자사 설명이므로 독립 검증된 업계 평균으로 받아들이면 안 된다. 하지만 초대형 클러스터의 핵심 난제가 무엇인지 보여주는 지표로는 의미가 있다.
Huawei가 전통적 10만 카드 클러스터의 예로 제시한 실제 모델 컴퓨팅 활용률. 규모가 커질수록 통신 대기가 연산을 잠식할 수 있다는 주장이다.
Huawei가 현재 배치 중이라고 밝힌 Atlas 950 SuperCluster의 카드 수. ‘100만’과 달리 실제 배치가 공식 확인된 규모다.
Peerium이 목표로 하는 프로세서급 확장 규모. 실전 경쟁력은 숫자가 아니라 이 규모에서 활용률과 안정성을 얼마나 유지하느냐에 달려 있다.
100만 개가 되면 무엇이 어려워질까
| 병목 | 왜 커지는가 | 시스템이 풀어야 할 문제 |
|---|---|---|
| Networking | 가속기 수가 늘수록 동시 통신량과 혼잡이 폭증한다. | 고대역폭, 낮은 지연시간, 혼잡 제어, 효율적인 collective communication |
| Memory | 초대형 모델은 한 가속기의 메모리에 들어가지 않는다. | 메모리 풀링, KV cache 관리, 데이터 이동 최소화 |
| Synchronization | 일부 노드가 늦어지면 전체 학습 반복이 기다린다. | 작업 분할, 스케줄링, straggler 완화 |
| Reliability | 부품 수가 많아지면 일부 장애는 예외가 아니라 일상이 된다. | 장애 격리, 체크포인트, 자동 재시작, 우회 경로 |
| Power & Cooling | 연산뿐 아니라 네트워크와 메모리도 전력을 소비한다. | 전력밀도, 액체냉각, 광인터커넥트, 데이터센터 설계 |
| Software | 하드웨어가 많아질수록 프로그램이 이를 효율적으로 써야 한다. | 컴파일러, 라이브러리, 런타임, 분산 학습·추론 프레임워크 |
그래서 Nvidia의 해자는 GPU 바깥에 있다
이 관점으로 보면 Huawei의 Peerium은 Nvidia를 위협하는 기술인 동시에 Nvidia가 왜 강한지를 보여주는 거울이다. Nvidia의 GB300 NVL72는 72개 Blackwell Ultra GPU를 NVLink로 연결해 하나의 거대한 가속기처럼 동작시키고, NVLink 도메인 내부에서 총 130TB/s의 GPU 통신 대역폭을 제공한다. 더 큰 규모에서는 Spectrum-X Ethernet과 InfiniBand가 rack 바깥의 수천, 수만 GPU를 연결한다.
Nvidia는 여기서 멈추지 않는다. CUDA가 개발 생태계를 묶고, NCCL과 통신 라이브러리가 분산 연산을 처리하며, Dynamo는 분산 추론에서 KV cache와 라우팅, 오토스케일링을 조정한다. 결국 Nvidia의 제품은 ‘GPU’라기보다 GPU를 높은 활용률로 계속 일하게 만드는 전체 시스템에 가까워지고 있다.
Huawei도 같은 문제를 풀기 위해 UnifiedBus를 전면에 세웠다. CPU, NPU, 메모리, SSD, NIC, 스위치를 하나의 프로토콜로 연결하고, 향후 Atlas 960에는 near-packaged optics를 적용할 계획이다. 서로 다른 기술 스택이지만 두 회사가 향하는 방향은 같다. AI 경쟁의 핵심은 FLOPS를 만드는 칩보다 그 FLOPS를 낭비하지 않는 시스템이다.
Huawei의 전략을 “물량으로 Nvidia를 압도한다”라고 해석하면 핵심을 놓친다. 개별 가속기의 성능이 낮으면 같은 작업에 더 많은 칩, 더 많은 네트워크, 더 많은 전력과 공간이 필요할 수 있다. 규모가 커질수록 통신 오버헤드와 장애 관리비용도 증가한다. 따라서 100만이라는 숫자 자체는 경쟁력이 아니다.
반대로 이 접근을 과소평가해서도 안 된다. AI 인프라의 최종 고객이 원하는 것은 벤치마크 1위 칩이 아니라 필요한 모델을 원하는 시간과 비용 안에 학습·추론하는 시스템이다. 중국이 최첨단 공정과 HBM에서 제약을 받더라도 인터커넥트, 시스템 소프트웨어, 데이터센터 운영으로 열세 일부를 상쇄할 수 있다면 ‘충분히 좋은 컴퓨팅’을 대규모로 공급하는 별도의 생태계를 만들 수 있다.
지금 확인해야 할 것은 Huawei가 100만을 말했느냐가 아니다. 25.6만 카드에서 실제 활용률, 안정성, 전력효율, 개발 편의성을 얼마나 증명하느냐 다. 그 결과가 100만으로 가는 길의 현실성을 판단할 첫 시험대다.
- 아니다. Huawei는 Peerium이 최대 100만 프로세서급으로 확장될 수 있는 아키텍처라고 발표했다. 현재 공식적으로 배치 중이라고 밝힌 것은 25.6만 카드 규모 Atlas 950 SuperCluster이며, Atlas 960 계열은 테스트 단계다.
- 일부 워크로드에서는 가능하지만 선형적으로 늘지는 않는다. 칩이 많아질수록 통신, 동기화, 메모리 이동과 장애 처리 비용이 커진다. 중요한 것은 개수가 아니라 추가된 칩이 실제 유효 연산으로 얼마나 전환되는가다.
- 단기적인 시장점유율 변화로 단정하기 어렵다. 오히려 시스템 경쟁이 중요해질수록 Nvidia의 네트워크와 소프트웨어 자산 가치가 커질 수 있다. 다만 중국 내에서 Huawei가 ‘충분히 좋은’ 대체 시스템을 안정적으로 공급한다면 Nvidia가 접근하기 어려운 시장에 독자 생태계가 더 빠르게 형성될 수 있다.
- 개별 칩의 FLOPS만 보지 말고 HBM 용량과 대역폭, chip-to-chip interconnect, scale-out 네트워크, 실제 클러스터 활용률, 전력효율, 소프트웨어 생태계까지 함께 봐야 한다. 경쟁 단위가 이미 칩에서 AI factory 전체로 커지고 있기 때문이다.
체크 포인트
인사이트 타임스 편집부





