딥시크가 HBM을 75% 덜 쓰니 SK하이닉스에 타격? 시장이 놓친 숫자는 따로 있다
V4.1 Flash는 실제로 KV 캐시의 HBM 사용량을 4분의 1로 줄였다. 그러나 이것을 “AI 전체 HBM 수요가 75% 사라진다”로 읽으면 기술도, 투자도 잘못 해석하게 된다. 지금 봐야 할 것은 메모리 절감률보다 그 절감이 더 많은 AI 사용량을 얼마나 만들어내는지다.

20초 핵심
주가가 먼저 반응했다. 하지만 원인은 하나가 아니었다
9월 11일 삼성전자는 3.53% 하락했고 SK하이닉스는 2.21% 내렸다. 딥시크의 V4.1 Flash 발표가 “AI가 생각보다 훨씬 적은 메모리로 돌아갈 수 있다”는 우려를 자극한 것은 맞다.
다만 이날 하락을 딥시크 하나로 설명하면 지나치게 단순하다. 같은 날 코스피도 1.76% 하락했다. 중동발 유가 상승과 미국 국채금리 급등이 기술주 전반을 누르고 있었다. 딥시크는 약한 시장에서 메모리주에 추가로 붙은 악재에 가까웠다.
딥시크가 정말 75% 줄인 것은 무엇인가
핵심은 KV 캐시다. 대형언어모델은 긴 문장을 읽은 뒤 다음 단어를 만들 때, 앞에서 이미 읽은 내용을 매번 처음부터 계산하지 않는다. 그 과정에서 필요한 중간 정보를 GPU 메모리에 저장해 두는데 이것이 KV 캐시다.
쉽게 말하면 책을 읽으며 중요한 페이지에 포스트잇을 붙여두는 것과 비슷하다. 포스트잇이 많을수록 다시 찾기는 빠르지만 공간을 많이 차지한다. 딥시크는 이 포스트잇을 훨씬 작게 만들고 여러 층에서 재사용하는 구조를 설계했다.
딥시크 공식 설명에 따르면 V4.1 Flash는 5520억 파라미터의 MoE 모델이지만 입력 처리에서는 80억, 출력 생성에서는 160억 파라미터만 활성화한다. 그리고 이전 세대와 비교해 KV 캐시에 필요한 HBM을 4분의 1, SSD를 8분의 1로 줄였다.
여기서 가장 많이 생기는 오해
| 발표 숫자 | 정확한 의미 | 과장된 해석 |
|---|---|---|
| HBM 1/4 | 동일 조건에서 KV 캐시가 차지하는 HBM 감소 | AI 서버의 전체 HBM이 75% 감소 |
| SSD 1/8 | 영속 KV 캐시 저장량 감소 | 데이터센터 전체 SSD 수요가 87.5% 감소 |
| 8B / 16B 활성 | 한 토큰을 처리할 때 계산에 참여하는 전문가 파라미터 | 552B 모델이 사실상 8B 또는 16B 모델 |
MoE의 “활성 파라미터”는 특히 오해하기 쉽다. 거대한 도서관에서 질문에 필요한 몇 개 서가만 열어본다고 해서 나머지 책이 사라지는 것은 아니다. 계산에 참여하는 파라미터는 줄어도 전체 모델 가중치를 저장하고 여러 GPU에 배치해야 하는 부담은 남는다.
학습 때 필요한 메모리는 더 별개의 문제다. 기울기, 옵티마이저 상태, 중간 활성값 등은 KV 캐시와 다른 종류의 메모리를 요구한다. 그래서 이번 발표는 추론 효율의 큰 진전이지, AI 메모리 수요 전체를 4분의 1로 만든 사건은 아니다.
오히려 서버 사업자에게는 “같은 HBM으로 네 배 더 하기”에 가깝다
이 기술이 실제 서비스에 주는 효과는 HBM을 떼어내는 것보다 같은 GPU에서 더 많은 일을 처리하는 것에 가깝다. 긴 대화를 더 오래 유지하고, 동시에 더 많은 이용자를 받고, 코딩 에이전트를 여러 개 병렬로 돌릴 수 있다.
KV 캐시의 토큰당 메모리가 4분의 1이 되더라도, 동시에 메모리에 올려두는 캐시 토큰 수가 4배가 되면 이 부분의 총 HBM 사용량은 다시 원래 수준이 된다.
이 점이 HBM 투자에서 가장 중요하다. 앞으로의 수요는 단순히 “모델 하나가 몇 GB를 쓰느냐”로 결정되지 않는다. 토큰당 메모리 × 동시 세션 수 × 평균 컨텍스트 길이 × 전체 호출량이 함께 움직인다.
AI 비용이 떨어지면 기업은 보통 절감된 비용을 그대로 현금으로 남기기보다 더 많은 추론에 쓴다. 검색 한 번에 모델을 한 번 호출하던 서비스가 에이전트 내부에서 수십 번 호출하는 식이다. 효율 개선이 총사용량 증가를 부르는, 이른바 반동 효과가 나타날 수 있다.
그렇다고 메모리 업체가 안심할 뉴스도 아니다
반대쪽 위험도 분명하다. 딥시크의 방식이 다른 프런티어 모델과 오픈소스 모델로 빠르게 확산되고, 동시에 AI 사용량 증가 속도가 둔화한다면 상황은 달라진다. 특히 긴 컨텍스트와 에이전트 서비스에서 KV 캐시가 병목이었던 서버는 같은 트래픽을 더 적은 GPU와 HBM으로 처리할 수 있다.
메모리 업계가 기대해 온 미래 수요 중에는 “모델이 커지고 컨텍스트가 길어질수록 서버당 HBM이 계속 늘어난다”는 가정이 들어 있다. V4.1 Flash는 적어도 그 가정이 자동으로 성립하지는 않는다는 것을 보여줬다.
다만 불과 하루 전인 9월 10일에는 중국 AI 가속기 업체들이 HBM 부족 때문에 제품 가격을 20~50%까지 올리고 있다는 보도도 나왔다. 실제 공급망에서는 아직 HBM이 병목이라는 증거가 동시에 존재한다. 효율 혁신과 물리적 부족이 같은 시점에 공존하고 있는 셈이다.
이번 딥시크 발표를 HBM 슈퍼사이클 종료 신호로 보기는 이르다. 반대로 “AI 사용량은 무조건 폭증하니 아무 영향이 없다”고 무시하는 것도 위험하다.
보기에 투자자가 바꿔야 할 질문은 하나다. “모델당 HBM이 얼마나 늘어나는가”에서 “AI 한 단위당 메모리 집약도가 떨어지는 속도보다 전체 AI 작업량이 더 빨리 늘어나는가”로 질문을 바꿔야 한다.
딥시크는 분명 메모리 집약도를 낮췄다. 이제 삼성전자와 SK하이닉스의 장기 논리는 그보다 더 빠르게 추론 토큰, 에이전트 호출, 멀티모달 데이터와 동시 세션이 늘어날 수 있느냐에 달려 있다.
- 완전히 틀린 말은 아니지만 범위를 붙여야 한다. 이전 V4 Flash와 비교한 KV 캐시용 HBM 이 약 75% 줄었다는 뜻이다. 서버 전체 HBM 사용량이 75% 감소했다는 의미는 아니다.
- 아니다. 필요한 전문가만 골라 계산한다는 뜻이다. 전체 전문가 가중치는 여전히 저장되어 있어야 하며, 서비스 규모에 따라 여러 GPU와 노드에 분산된다.
- 단기적으로는 악재에 가깝다. 같은 추론 작업에 필요한 메모리가 줄어들 수 있기 때문이다. 그러나 중장기 총수요는 비용 하락이 얼마나 많은 신규 AI 사용량을 만들어내느냐에 달려 있다. 현재는 어느 한쪽으로 단정하기 어렵다.
- 일부 영향은 있었지만 전부는 아니다. 9월 11일 코스피 자체가 1.76% 하락했고, 유가 상승과 미국 국채금리 급등이 기술주 전반의 할인율 부담을 키웠다. 삼성전자 -3.53%, SK하이닉스 -2.21%의 낙폭에는 거시 요인과 딥시크 충격이 함께 들어가 있다고 보는 편이 타당하다.
체크 포인트
인사이트 타임스 편집부





