Grok 4.7의 진짜 무기는 성능이 아니라 ‘일을 끝내는 비용’이다
입력 100만 토큰당 2달러, 출력 6달러. SpaceXAI는 Grok 4.7을 장시간 코딩과 지식 업무에 투입되는 에이전트 모델로 밀고 있다. 투자자가 볼 숫자는 벤치마크 1등 여부보다 한 업무를 끝낼 때까지 들어가는 총비용과 실제 채택률이다.

20초 핵심
이번 모델에서 달라진 것은 ‘몇 분짜리 답변’이 아니다
SpaceXAI는 Grok 4.7을 “coding and knowledge work”용 최상위 모델로 소개했다. 핵심은 더 큰 베이스 모델, 더 긴 강화학습, 그리고 수 시간짜리 과제에 높은 비중을 둔 훈련이다. 모델이 코드를 한 번 잘 쓰는 것보다 저장소를 읽고, 여러 파일을 수정하고, 테스트를 돌리고, 실패 원인을 다시 고쳐 끝까지 작업을 마치는 능력을 겨냥했다.
| 지표 | Grok 4.7 | Grok 4.6 | 읽는 법 |
|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 장시간 소프트웨어 엔지니어링 과제의 완결성 개선 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 명령줄 기반 다단계 작업에서 큰 폭 개선 |
| 입력 가격 | $2 / 100만 토큰 | $2 | 이전 세대와 동일 |
| 출력 가격 | $6 / 100만 토큰 | $6 | 에이전트형 업무에서 특히 중요한 비용 |
다만 이 수치는 SpaceXAI가 공개한 자사 평가표다. 같은 환경에서 비교했다는 점은 유용하지만, 독립 평가와 실제 기업 환경의 성공률이 뒤따라야 한다. 벤치마크 46.3%는 곧바로 “업무의 46.3%가 자동화된다”는 뜻도 아니다.
AI 에이전트의 경제성은 ‘토큰 가격 × 재시도 횟수’에서 결정된다
일반 챗봇은 질문 한 번, 답변 한 번으로 끝날 수 있다. 에이전트는 다르다. 계획을 세우고, 파일을 읽고, 코드를 수정하고, 로그를 해석하고, 실패하면 다시 시도한다. 업무가 길어질수록 출력 토큰과 도구 호출이 쌓인다.
월간 1억 입력 토큰과 5천만 출력 토큰을 사용하는 개발 자동화 업무를 단순 가정하면 Grok 4.7의 토큰 비용은 약 500달러다. SpaceXAI의 비교표에 제시된 GPT-5.6 Sol 가격을 같은 방식으로 적용하면 1,400달러다.
그러나 이 계산에는 가장 중요한 변수가 빠져 있다. 성공률이다. 싼 모델이 같은 업무를 세 번 재시도한다면 비싼 모델보다 총비용이 높아질 수 있다. 앞으로 기업 고객이 비교할 지표는 ‘100만 토큰 가격’보다 한 개의 실제 업무를 성공적으로 끝내는 데 얼마가 드는가가 될 가능성이 크다.
SpaceXAI는 모델보다 유통망을 먼저 깔고 있다
Grok 4.7은 Cursor, Grok Build, 공개 API, OpenRouter·Vercel·Cloudflare 같은 모델 게이트웨이를 통해 배포된다. 특히 Cursor에 바로 들어간다는 점이 중요하다. 개발자는 새 AI 앱으로 이동하지 않아도 기존 코딩 환경에서 모델을 시험할 수 있다.
여기서 투자 포인트가 나온다. 모델 성능 차이가 작아질수록 시장을 결정하는 것은 배포 채널, 전환 비용, 가격, 응답속도, 보안정책이 된다. 좋은 모델을 만드는 경쟁에서 기업의 실제 워크플로 안에 자리를 차지하는 경쟁으로 이동하는 것이다.
안전성은 이제 연구실 문제가 아니라 기업 조달 조건이다
SpaceXAI는 Grok 4.7에 새로운 safeguard stack을 적용했고, LatchBio 바이오안전성 평가에서 62.4%, HackerBench v0.3에서 위험한 이중용도 프롬프트 허용 비율 3.3%를 제시했다. 일부 보안 파트너에게는 방어 연구용 레드팀 기능도 제한적으로 제공하기 시작했다.
이 역시 회사가 제시한 평가라는 한계가 있다. 하지만 방향은 분명하다. 에이전트가 내부 코드 저장소, 클라우드 계정, 고객 데이터와 연결될수록 안전성은 ‘좋으면 있는 기능’이 아니라 계약을 따내기 위한 필수 조건이 된다. 독립 평가, 감사 로그, 권한 통제, 데이터 보존 정책이 모델 점수만큼 중요해질 수 있다.
더 큰 변수는 SpaceX와 AI가 이미 한 회사가 됐다는 점이다
2026년 2월 SpaceX는 xAI를 인수했다. 현재 공식 AI 사업 브랜드도 SpaceXAI다. 따라서 Grok의 데이터와 컴퓨트 전략을 예전처럼 독립 AI 스타트업만의 문제로 볼 수 없다.
머스크는 차세대 Grok 5에 약 25년간 축적된 SpaceX 엔지니어링 데이터를 활용하겠다는 구상을 공개적으로 언급해 왔다. 별도로 SpaceXAI 내부에서는 어려움을 겪거나 문을 닫은 스타트업의 고객·운영 데이터를 사들이는 방안도 논의된 것으로 보도됐다. 후자는 아직 비공식 논의 단계이며 실제 거래로 이어진 것은 아니다.
이 데이터가 진짜 해자가 되려면 양보다 품질이 중요하다. 로켓 텔레메트리, 제조, 고장 분석처럼 결과가 물리적으로 검증되는 데이터는 희소하다. 그러나 법적 사용권한, 개인정보, 고객기밀, 정제 품질, 모델 학습 효과가 해결되지 않으면 ‘25년치 데이터’라는 숫자만으로 성능 우위를 보장할 수 없다.
Grok 4.7을 “OpenAI나 Anthropic을 이겼다”는 순위 기사로 읽으면 중요한 부분을 놓친다. 이번 발표의 신호는 프런티어 모델 경쟁의 단위가 모델 한 번의 정답률에서 장시간 업무의 총경제성으로 바뀌고 있다는 것 이다.
이 변화는 모델 기업에는 양날의 검이다. 가격을 낮추면 개발자 채택과 추론량은 빠르게 늘 수 있다. 반대로 모델 가격이 하락하는 속도보다 GPU, 전력, 데이터센터 원가가 느리게 내려가면 매출이 늘어도 이익은 남지 않는다.
따라서 AI 투자자는 ‘누가 가장 똑똑한 모델을 만들었는가’보다 세 질문을 보는 편이 낫다. 사용량이 늘고 있는가. 같은 업무를 더 적은 재시도로 끝내는가. 그리고 그 사용량이 실제 추론 마진으로 남는가. Grok 4.7은 이 세 질문을 더 중요하게 만든 모델이다.
- 그렇게 단정하기 어렵다. SpaceXAI의 자사 표에서 일부 장시간 작업 지표는 강하지만 모든 벤치마크에서 1위는 아니다. 실제 저장소와 독립 평가에서의 결과가 더 중요하다.
- 아니다. 낮은 가격은 채택을 빠르게 만들 수 있지만 추론 원가가 충분히 낮지 않으면 마진을 훼손한다. 사용량 성장과 단위당 원가를 함께 봐야 한다.
- 현재 공식 문서상 Grok 4.7 Fast는 Cursor와 Grok Build 전용이며 공개 xAI API에서는 제공되지 않는다. 표준 Grok 4.7은 API에서 사용할 수 있다.
- 가능성은 있지만 아직 검증되지 않았다. 데이터의 희소성보다 실제 학습효과, 정제 품질, 사용권한, 제품화가 더 중요하다.
체크 포인트
인사이트 타임스 편집부





