EXPLAIN테크

Nvidia보다 느린 칩을 100만 개 연결하면 어떻게 될까

Huawei가 내놓은 답은 더 빠른 칩 하나가 아니다. 최대 100만 개 프로세서를 하나의 컴퓨터처럼 묶는 것이다. 이 시도는 중국의 Nvidia 추격전인 동시에, AI 반도체 경쟁의 진짜 단위가 ‘칩’에서 ‘시스템’으로 이동하고 있음을 보여준다.

20초 핵심

1
Huawei는 2027년 1분기 Ascend 960DT, 3분기 960PR을 내놓을 계획이다. 그러나 더 중요한 발표는 최대 100만 프로세서급 확장을 목표로 한 Peerium Computing Architecture다.
2
핵심 문제는 칩 개수가 아니다. Huawei 스스로 전통적 구조의 10만 카드 클러스터에서 실제 모델 컴퓨팅 활용률이 약 20%까지 떨어질 수 있다고 설명한다. 대규모 AI의 병목은 연산보다 ‘연결’에서 생긴다.
3
Huawei의 도전은 역설적으로 Nvidia의 해자를 설명한다. GPU 성능만이 아니라 NVLink, NVSwitch, Spectrum-X, CUDA와 분산 추론 소프트웨어까지 한 시스템으로 묶는 능력이 AI 인프라 경쟁의 핵심이 되고 있다.

칩 하나가 느리다면, 시스템을 더 크게 만든다

Huawei는 9월 17일 Shanghai의 HUAWEI CONNECT 2026에서 차세대 Ascend 로드맵을 공개했다. Ascend 960DT는 당초 계획보다 세 분기 앞당긴 2027년 1분기, Ascend 960PR은 한 분기 앞당긴 2027년 3분기 출시를 예고했다. Reuters는 Huawei의 중국 내 AI 컴퓨팅 장비 수요가 현재 생산능력을 넘어섰다고 전했다.

하지만 이번 발표에서 더 중요한 숫자는 960이 아니라 1,000,000이다. Huawei가 공개한 Peerium은 중첩 병렬처리, 통합 메모리 주소 체계, 프로세서 간 동등 연결을 통해 최대 100만 프로세서급 시스템을 하나의 거대한 컴퓨터처럼 움직이게 하겠다는 아키텍처다.

여기서 팩트의 경계는 분명해야 한다. 100만 프로세서 시스템이 이미 가동 중이라는 뜻은 아니다. Huawei가 현재 배치 중이라고 공식 확인한 것은 25.6만 카드 규모의 Atlas 950 SuperCluster다. 100만은 Peerium이 지향하는 확장 규모이며, Atlas 960 계열 시스템은 현재 테스트 단계다.

AI의 총성능은 ‘칩 성능 × 개수’가 아니다

대규모 AI 시스템을 직관적으로 이해하려면 다음 식이 더 가깝다.

유효 AI 성능 ≈ 칩 성능 × 칩 수 × 실제 활용률
Chip
Rack
Cluster
Data Center

칩을 10배 늘려도 서로 데이터를 주고받느라 기다리는 시간이 늘면 성능은 10배가 되지 않는다. 학습 과정에서는 수많은 가속기가 매 단계마다 파라미터와 중간 결과를 교환하고 동기화해야 한다. 한쪽이 늦으면 나머지도 기다린다. ‘가장 느린 작업자’가 전체 반복 속도를 결정하는 straggler 문제가 발생한다.

Huawei가 말한 20%가 중요한 이유

Huawei는 이번 행사에서 기존 컴퓨팅 구조로 규모가 커질수록 자원 활용률이 떨어지며, 10만 카드 클러스터의 실제 모델 컴퓨팅 활용률이 약 20%에 불과할 수 있다고 설명했다. 이 수치는 Huawei가 제시한 자사 설명이므로 독립 검증된 업계 평균으로 받아들이면 안 된다. 하지만 초대형 클러스터의 핵심 난제가 무엇인지 보여주는 지표로는 의미가 있다.

20%

Huawei가 전통적 10만 카드 클러스터의 예로 제시한 실제 모델 컴퓨팅 활용률. 규모가 커질수록 통신 대기가 연산을 잠식할 수 있다는 주장이다.

25.6

Huawei가 현재 배치 중이라고 밝힌 Atlas 950 SuperCluster의 카드 수. ‘100만’과 달리 실제 배치가 공식 확인된 규모다.

100

Peerium이 목표로 하는 프로세서급 확장 규모. 실전 경쟁력은 숫자가 아니라 이 규모에서 활용률과 안정성을 얼마나 유지하느냐에 달려 있다.

100만 개가 되면 무엇이 어려워질까

병목왜 커지는가시스템이 풀어야 할 문제
Networking가속기 수가 늘수록 동시 통신량과 혼잡이 폭증한다.고대역폭, 낮은 지연시간, 혼잡 제어, 효율적인 collective communication
Memory초대형 모델은 한 가속기의 메모리에 들어가지 않는다.메모리 풀링, KV cache 관리, 데이터 이동 최소화
Synchronization일부 노드가 늦어지면 전체 학습 반복이 기다린다.작업 분할, 스케줄링, straggler 완화
Reliability부품 수가 많아지면 일부 장애는 예외가 아니라 일상이 된다.장애 격리, 체크포인트, 자동 재시작, 우회 경로
Power & Cooling연산뿐 아니라 네트워크와 메모리도 전력을 소비한다.전력밀도, 액체냉각, 광인터커넥트, 데이터센터 설계
Software하드웨어가 많아질수록 프로그램이 이를 효율적으로 써야 한다.컴파일러, 라이브러리, 런타임, 분산 학습·추론 프레임워크

그래서 Nvidia의 해자는 GPU 바깥에 있다

이 관점으로 보면 Huawei의 Peerium은 Nvidia를 위협하는 기술인 동시에 Nvidia가 왜 강한지를 보여주는 거울이다. Nvidia의 GB300 NVL72는 72개 Blackwell Ultra GPU를 NVLink로 연결해 하나의 거대한 가속기처럼 동작시키고, NVLink 도메인 내부에서 총 130TB/s의 GPU 통신 대역폭을 제공한다. 더 큰 규모에서는 Spectrum-X Ethernet과 InfiniBand가 rack 바깥의 수천, 수만 GPU를 연결한다.

Nvidia는 여기서 멈추지 않는다. CUDA가 개발 생태계를 묶고, NCCL과 통신 라이브러리가 분산 연산을 처리하며, Dynamo는 분산 추론에서 KV cache와 라우팅, 오토스케일링을 조정한다. 결국 Nvidia의 제품은 ‘GPU’라기보다 GPU를 높은 활용률로 계속 일하게 만드는 전체 시스템에 가까워지고 있다.

Huawei도 같은 문제를 풀기 위해 UnifiedBus를 전면에 세웠다. CPU, NPU, 메모리, SSD, NIC, 스위치를 하나의 프로토콜로 연결하고, 향후 Atlas 960에는 near-packaged optics를 적용할 계획이다. 서로 다른 기술 스택이지만 두 회사가 향하는 방향은 같다. AI 경쟁의 핵심은 FLOPS를 만드는 칩보다 그 FLOPS를 낭비하지 않는 시스템이다.

INSIGHT TIMES VIEW

Huawei의 전략을 “물량으로 Nvidia를 압도한다”라고 해석하면 핵심을 놓친다. 개별 가속기의 성능이 낮으면 같은 작업에 더 많은 칩, 더 많은 네트워크, 더 많은 전력과 공간이 필요할 수 있다. 규모가 커질수록 통신 오버헤드와 장애 관리비용도 증가한다. 따라서 100만이라는 숫자 자체는 경쟁력이 아니다.

반대로 이 접근을 과소평가해서도 안 된다. AI 인프라의 최종 고객이 원하는 것은 벤치마크 1위 칩이 아니라 필요한 모델을 원하는 시간과 비용 안에 학습·추론하는 시스템이다. 중국이 최첨단 공정과 HBM에서 제약을 받더라도 인터커넥트, 시스템 소프트웨어, 데이터센터 운영으로 열세 일부를 상쇄할 수 있다면 ‘충분히 좋은 컴퓨팅’을 대규모로 공급하는 별도의 생태계를 만들 수 있다.

지금 확인해야 할 것은 Huawei가 100만을 말했느냐가 아니다. 25.6만 카드에서 실제 활용률, 안정성, 전력효율, 개발 편의성을 얼마나 증명하느냐 다. 그 결과가 100만으로 가는 길의 현실성을 판단할 첫 시험대다.

Huawei가 100만 개 Ascend 칩을 이미 연결했다는 뜻인가?
  • 아니다. Huawei는 Peerium이 최대 100만 프로세서급으로 확장될 수 있는 아키텍처라고 발표했다. 현재 공식적으로 배치 중이라고 밝힌 것은 25.6만 카드 규모 Atlas 950 SuperCluster이며, Atlas 960 계열은 테스트 단계다.
칩 하나가 느려도 수를 늘리면 결국 더 빨라질 수 있나?
  • 일부 워크로드에서는 가능하지만 선형적으로 늘지는 않는다. 칩이 많아질수록 통신, 동기화, 메모리 이동과 장애 처리 비용이 커진다. 중요한 것은 개수가 아니라 추가된 칩이 실제 유효 연산으로 얼마나 전환되는가다.
이 뉴스가 Nvidia에 바로 악재인가?
  • 단기적인 시장점유율 변화로 단정하기 어렵다. 오히려 시스템 경쟁이 중요해질수록 Nvidia의 네트워크와 소프트웨어 자산 가치가 커질 수 있다. 다만 중국 내에서 Huawei가 ‘충분히 좋은’ 대체 시스템을 안정적으로 공급한다면 Nvidia가 접근하기 어려운 시장에 독자 생태계가 더 빠르게 형성될 수 있다.
AI 반도체 기업을 볼 때 이제 무엇을 비교해야 하나?
  • 개별 칩의 FLOPS만 보지 말고 HBM 용량과 대역폭, chip-to-chip interconnect, scale-out 네트워크, 실제 클러스터 활용률, 전력효율, 소프트웨어 생태계까지 함께 봐야 한다. 경쟁 단위가 이미 칩에서 AI factory 전체로 커지고 있기 때문이다.

체크 포인트

Atlas 950 25.6만 카드 클러스터의 실제 운용 데이터 - 학습 처리량, 활용률, 장애 복구 시간이 공개된다면 Peerium의 확장성을 검증할 첫 숫자가 된다.
Ascend 960DT의 2027년 1분기 출시 이행 여부 - 로드맵을 앞당긴 만큼 실제 양산량과 고객 공급이 따라오는지가 중요하다.
UnifiedBus와 NPO의 전력효율 - 칩 수가 커질수록 네트워크 전력이 총소유비용을 좌우한다. 광인터커넥트가 이 비용을 얼마나 낮추는지 봐야 한다.
소프트웨어 생태계와 개발자 전환비용 - Huawei 하드웨어가 좋아져도 CUDA 기반 코드를 얼마나 쉽게 옮길 수 있는지가 채택 속도를 결정한다.
Nvidia의 scale-out 진화 - Spectrum-X는 이미 12.8만 GPU급 2-tier 네트워크 확장을 제시한다. Huawei의 규모 확대는 Nvidia 역시 더 큰 AI factory 설계를 가속하게 만들 가능성이 있다.
AI 경쟁의 승부는 칩 속도보다 그 칩을 쉬지 않게 돌리는 연결과 소프트웨어에서 갈릴 가능성이 크다.

인사이트 타임스 편집부