로봇도 ‘처음 가본 집’에서 일하기 시작했다 - Figure Helix 2.5가 바꾼 휴머노이드의 경쟁 기준
Figure의 새 모델이 처음 보는 30개 가정에서 침대를 정리하고 수건을 접었다. 중요한 것은 로봇의 손재주보다, 인간 행동을 사전학습한 데이터가 새로운 장소로 얼마나 잘 전이되느냐다.

20초 핵심
사람에게 집안일은 장소가 바뀐다고 처음부터 다시 배우는 일이 아니다. 처음 들어간 집에서도 침대를 보고 이불을 펴고, 바닥의 물건을 주워 정리한다. 지금까지 로봇에게는 이 당연한 능력이 가장 어려운 문제 중 하나였다.
Figure가 공개한 Helix 2.5의 의미는 바로 여기에 있다. Figure는 이 모델을 샌프란시스코 베이 지역의 처음 보는 30개 가정에 투입해 거실 정리, 수건 접기, 침대 정리 세 가지 작업을 수행하게 했다. 평가 가정에서는 사전 데이터 수집이나 환경별 미세조정을 하지 않았다. Figure가 보고한 전체 작업 성공률은 56%였다.

‘제로샷’이라는 말을 정확히 이해해야 한다
이번 발표에서 가장 쉽게 과장될 수 있는 단어가 zero-shot이다. Helix 2.5가 수건 접기나 침대 정리를 아무 학습 없이 갑자기 해냈다는 뜻은 아니다.
Figure는 세 가지 작업을 다른 장소에서 수집한 작업별 데이터로 학습시켰다. 제로샷인 것은 평가 장소와 그곳의 물건이다. 로봇은 평가에 사용한 30개 가정의 구조와 장난감, 수건, 침구를 학습 과정에서 보지 않았고, 현장에 도착한 뒤 추가 적응도 하지 않았다.
이 차이가 중요하다. 지금까지 많은 로봇 시스템은 실제 투입 장소에서 데이터를 다시 모으고 조정해야 했다. 이런 방식은 공장 한 곳에서는 가능하지만 수백만 가정으로 확장하기 어렵다. 집마다 다시 학습해야 한다면 범용 가정용 로봇의 경제성은 성립하기 어렵기 때문이다.

9%에서 56% - 이번 발표에서 가장 중요한 숫자
Figure는 Index 사전학습의 효과를 따로 비교했다. 모델 구조, 작업별 데이터, 학습 방법과 평가 조건을 그대로 두고 초기 상태만 바꿨다.
처음부터 학습한 모델의 성공률은 9%였다. Index로 먼저 사전학습한 모델은 56%였다. 성공 기준도 느슨하지 않았다. 거실 정리는 13~15개의 장난감을 모두 바구니에 넣어야 했고, 수건은 접은 뒤 바구니에 넣어야 했으며, 침대도 정해진 기준을 끝까지 충족해야 했다. 부분 점수는 성공으로 계산하지 않았다.
이 결과가 맞다면 휴머노이드 경쟁의 중심이 달라질 가능성이 있다. 더 좋은 손이나 더 강한 모터만으로는 부족하다. 다양한 인간 행동을 얼마나 많이, 얼마나 넓게 수집해 하나의 물리적 세계 모델로 학습시키느냐가 핵심 자산이 될 수 있다.

LLM에서 일어났던 일이 로봇에서도 시작될까
Figure의 더 큰 주장은 ‘스케일링 법칙’이다. 회사는 Index 사전학습 데이터를 8배 범위에서 단계적으로 늘려 네 개 모델을 학습했고, 데이터가 늘수록 이후 로봇 행동 예측 손실이 매끄럽게 감소했다고 밝혔다. 작은 실험 결과만으로 가장 큰 학습 실행의 손실을 소수점 넷째 자리까지 예측했으며, 예측 오차는 전체 변화폭의 0.54%였다는 설명이다.
이 부분이 사실상 이번 발표의 가장 큰 산업적 함의다. 언어 모델은 데이터와 컴퓨팅을 늘리면 성능이 일정한 패턴으로 개선된다는 경험적 스케일링 법칙을 바탕으로 막대한 투자를 정당화해 왔다. 로봇에서도 비슷한 관계가 반복된다면 휴머노이드 개발은 ‘기술자의 수작업 튜닝’보다 데이터센터 규모의 학습 경쟁에 가까워질 수 있다.
Figure는 현재 Index가 매초 약 35분 분량의 새로운 인간 경험 데이터를 만들고 있다고 밝혔다. 하루로 환산하면 약 5.75년 분량의 영상이다. 회사는 Helix 학습을 위해 Nscale과 최대 10만 개의 NVIDIA Vera Rubin GPU 배치를 추진하며 초기 35억달러의 컴퓨팅 사용을 약정했다.

핵심 한 장
이 구조가 실제로 작동한다면 로봇의 소프트웨어 경제성이 크게 달라진다. 한 고객을 추가할 때마다 학습 비용이 반복되는 구조에서, 하나의 기반 모델 비용을 수많은 로봇과 장소에 나눠 쓰는 구조로 이동하기 때문이다.

그러나 아직 ‘가정용 로봇의 ChatGPT 순간’이라고 부르기에는 이르다
56% 성공률은 연구 단계에서는 의미가 크지만 소비자 제품이라면 전혀 다른 기준이 적용된다. 세 번 중 한 번 이상 실패할 수 있는 로봇에게 유리컵 정리나 뜨거운 조리도구 처리를 맡기기는 어렵다.
또 이번 평가는 Figure가 설계하고 수행한 회사 자체 실험이다. 30개 가정이라는 환경 다양성은 이전보다 넓지만 세 가지 작업으로 일반 물리 지능을 증명했다고 보기는 어렵다. 작업별 성공률, 평균 완료 시간, 사람의 안전 개입 빈도, 원격 지원 여부 같은 상용화 핵심 지표도 이번 발표만으로는 충분히 확인하기 어렵다.
따라서 이번 결과를 ‘휴머노이드 문제가 해결됐다’고 읽는 것은 과하다. 더 정확한 해석은 ‘새 환경마다 다시 가르쳐야 하는 로봇에서, 인간 경험을 대규모로 사전학습해 지식을 전이하는 로봇으로 가는 경로가 처음으로 꽤 구체적인 숫자를 얻었다’는 것이다.
휴머노이드 산업에서 가장 중요한 병목이 하드웨어라고 생각하기 쉽다. 하지만 Helix 2.5가 보여준 방향은 조금 다르다. 로봇 몸체가 비슷한 수준까지 올라온 뒤의 경쟁은 결국 ‘누가 물리 세계의 데이터를 가장 많이 확보하고, 그 데이터를 실제 행동으로 가장 잘 전이하느냐’가 될 가능성이 있다.
이 관점에서 Figure의 진짜 자산은 Figure 03 한 대가 아니라 Index와 Helix를 연결한 데이터 플라이휠이다. 사람의 행동 영상이 늘고, 모델이 좋아지고, 더 많은 로봇이 배치되며, 다시 더 다양한 실제 데이터가 쌓이는 구조다.
다만 이 플라이휠의 경제성은 아직 증명되지 않았다. 데이터와 GPU에 수십억달러를 투입해 성공률을 56%에서 90%, 99%, 99.9%까지 끌어올릴 때 비용 곡선이 어떻게 변하는지가 더 중요하다. 마지막 몇 퍼센트가 가장 비쌀 수 있기 때문이다.
- 아니다. 세 가지 작업 자체는 다른 환경에서 수집한 데이터로 학습했다. 이번 ‘제로샷’은 평가한 집과 물건을 사전에 학습하지 않았다는 뜻이다.
- 연구 관점에서는 9%에서 56%로 오른 변화가 중요하다. 상용 제품 관점에서는 아직 낮다. 가정용 로봇은 안전성과 반복 신뢰성이 훨씬 높은 수준까지 올라가야 한다.
- Index는 여러 국가와 환경에서 인간이 실제로 움직이고 물건을 다루는 영상을 대규모로 모은다. 로봇이 특정 집의 동작을 외우는 대신 다양한 물리적 상황의 공통 패턴을 미리 학습하게 하려는 것이다.
- 그렇다. 특정 회사의 우위를 바로 증명하는 결과는 아니지만 휴머노이드 경쟁에서 데이터 규모, 데이터 다양성, 학습 컴퓨팅이 하드웨어만큼 중요한 경쟁 변수가 될 수 있음을 보여준다.
- 새로운 작업을 거의 추가 학습 없이 수행하는 범용성이 핵심이다. 지금은 ‘새 집에서 배운 일을 잘하는가’를 보여준 단계다. 다음 단계는 ‘처음 보는 집에서 처음 보는 일을 어느 정도까지 해낼 수 있는가’다.
체크 포인트
인사이트 타임스 편집부





