SO WHAT테크

Grok 4.7의 진짜 무기는 성능이 아니라 ‘일을 끝내는 비용’이다

입력 100만 토큰당 2달러, 출력 6달러. SpaceXAI는 Grok 4.7을 장시간 코딩과 지식 업무에 투입되는 에이전트 모델로 밀고 있다. 투자자가 볼 숫자는 벤치마크 1등 여부보다 한 업무를 끝낼 때까지 들어가는 총비용과 실제 채택률이다.

20초 핵심

1
Grok 4.7은 Grok 4.6과 같은 토큰 가격을 유지하면서 장시간 코딩 벤치마크를 크게 개선했다. SpaceXAI의 승부처는 최고 성능보다 가격 대비 완결성이다.
2
에이전트 시대에는 출력 토큰과 재시도가 급증한다. 모델 단가가 낮고 성공률이 높으면 기업의 ‘업무당 AI 비용’이 크게 내려갈 수 있다.
3
낮은 가격은 동시에 위험이다. 사용량이 늘어도 추론 원가가 더 빨리 늘면 매출이 아니라 현금소모가 커진다. 결국 인프라 효율이 기업가치를 가른다.

이번 모델에서 달라진 것은 ‘몇 분짜리 답변’이 아니다

SpaceXAI는 Grok 4.7을 “coding and knowledge work”용 최상위 모델로 소개했다. 핵심은 더 큰 베이스 모델, 더 긴 강화학습, 그리고 수 시간짜리 과제에 높은 비중을 둔 훈련이다. 모델이 코드를 한 번 잘 쓰는 것보다 저장소를 읽고, 여러 파일을 수정하고, 테스트를 돌리고, 실패 원인을 다시 고쳐 끝까지 작업을 마치는 능력을 겨냥했다.

지표Grok 4.7Grok 4.6읽는 법
CursorBench 4.046.3%40.4%장시간 소프트웨어 엔지니어링 과제의 완결성 개선
Terminal-Bench 4.038.0%20.3%명령줄 기반 다단계 작업에서 큰 폭 개선
입력 가격$2 / 100만 토큰$2이전 세대와 동일
출력 가격$6 / 100만 토큰$6에이전트형 업무에서 특히 중요한 비용

다만 이 수치는 SpaceXAI가 공개한 자사 평가표다. 같은 환경에서 비교했다는 점은 유용하지만, 독립 평가와 실제 기업 환경의 성공률이 뒤따라야 한다. 벤치마크 46.3%는 곧바로 “업무의 46.3%가 자동화된다”는 뜻도 아니다.

AI 에이전트의 경제성은 ‘토큰 가격 × 재시도 횟수’에서 결정된다

일반 챗봇은 질문 한 번, 답변 한 번으로 끝날 수 있다. 에이전트는 다르다. 계획을 세우고, 파일을 읽고, 코드를 수정하고, 로그를 해석하고, 실패하면 다시 시도한다. 업무가 길어질수록 출력 토큰과 도구 호출이 쌓인다.

$2
Grok 4.7 입력 100만 토큰당 시작 가격
$6
Grok 4.7 출력 100만 토큰당 시작 가격
2×
Fast 버전의 출력 속도와 가격. 현재 Cursor와 Grok Build에서 제공

월간 1억 입력 토큰과 5천만 출력 토큰을 사용하는 개발 자동화 업무를 단순 가정하면 Grok 4.7의 토큰 비용은 약 500달러다. SpaceXAI의 비교표에 제시된 GPT-5.6 Sol 가격을 같은 방식으로 적용하면 1,400달러다.

Grok 4.7 입력100 × $2 = $200
Grok 4.7 출력50 × $6 = $300
합계$500

그러나 이 계산에는 가장 중요한 변수가 빠져 있다. 성공률이다. 싼 모델이 같은 업무를 세 번 재시도한다면 비싼 모델보다 총비용이 높아질 수 있다. 앞으로 기업 고객이 비교할 지표는 ‘100만 토큰 가격’보다 한 개의 실제 업무를 성공적으로 끝내는 데 얼마가 드는가가 될 가능성이 크다.

SpaceXAI는 모델보다 유통망을 먼저 깔고 있다

Grok 4.7은 Cursor, Grok Build, 공개 API, OpenRouter·Vercel·Cloudflare 같은 모델 게이트웨이를 통해 배포된다. 특히 Cursor에 바로 들어간다는 점이 중요하다. 개발자는 새 AI 앱으로 이동하지 않아도 기존 코딩 환경에서 모델을 시험할 수 있다.

여기서 투자 포인트가 나온다. 모델 성능 차이가 작아질수록 시장을 결정하는 것은 배포 채널, 전환 비용, 가격, 응답속도, 보안정책이 된다. 좋은 모델을 만드는 경쟁에서 기업의 실제 워크플로 안에 자리를 차지하는 경쟁으로 이동하는 것이다.

안전성은 이제 연구실 문제가 아니라 기업 조달 조건이다

SpaceXAI는 Grok 4.7에 새로운 safeguard stack을 적용했고, LatchBio 바이오안전성 평가에서 62.4%, HackerBench v0.3에서 위험한 이중용도 프롬프트 허용 비율 3.3%를 제시했다. 일부 보안 파트너에게는 방어 연구용 레드팀 기능도 제한적으로 제공하기 시작했다.

이 역시 회사가 제시한 평가라는 한계가 있다. 하지만 방향은 분명하다. 에이전트가 내부 코드 저장소, 클라우드 계정, 고객 데이터와 연결될수록 안전성은 ‘좋으면 있는 기능’이 아니라 계약을 따내기 위한 필수 조건이 된다. 독립 평가, 감사 로그, 권한 통제, 데이터 보존 정책이 모델 점수만큼 중요해질 수 있다.

더 큰 변수는 SpaceX와 AI가 이미 한 회사가 됐다는 점이다

2026년 2월 SpaceX는 xAI를 인수했다. 현재 공식 AI 사업 브랜드도 SpaceXAI다. 따라서 Grok의 데이터와 컴퓨트 전략을 예전처럼 독립 AI 스타트업만의 문제로 볼 수 없다.

머스크는 차세대 Grok 5에 약 25년간 축적된 SpaceX 엔지니어링 데이터를 활용하겠다는 구상을 공개적으로 언급해 왔다. 별도로 SpaceXAI 내부에서는 어려움을 겪거나 문을 닫은 스타트업의 고객·운영 데이터를 사들이는 방안도 논의된 것으로 보도됐다. 후자는 아직 비공식 논의 단계이며 실제 거래로 이어진 것은 아니다.

이 데이터가 진짜 해자가 되려면 양보다 품질이 중요하다. 로켓 텔레메트리, 제조, 고장 분석처럼 결과가 물리적으로 검증되는 데이터는 희소하다. 그러나 법적 사용권한, 개인정보, 고객기밀, 정제 품질, 모델 학습 효과가 해결되지 않으면 ‘25년치 데이터’라는 숫자만으로 성능 우위를 보장할 수 없다.

INSIGHT TIMES VIEW

Grok 4.7을 “OpenAI나 Anthropic을 이겼다”는 순위 기사로 읽으면 중요한 부분을 놓친다. 이번 발표의 신호는 프런티어 모델 경쟁의 단위가 모델 한 번의 정답률에서 장시간 업무의 총경제성으로 바뀌고 있다는 것 이다.

이 변화는 모델 기업에는 양날의 검이다. 가격을 낮추면 개발자 채택과 추론량은 빠르게 늘 수 있다. 반대로 모델 가격이 하락하는 속도보다 GPU, 전력, 데이터센터 원가가 느리게 내려가면 매출이 늘어도 이익은 남지 않는다.

따라서 AI 투자자는 ‘누가 가장 똑똑한 모델을 만들었는가’보다 세 질문을 보는 편이 낫다. 사용량이 늘고 있는가. 같은 업무를 더 적은 재시도로 끝내는가. 그리고 그 사용량이 실제 추론 마진으로 남는가. Grok 4.7은 이 세 질문을 더 중요하게 만든 모델이다.

Grok 4.7이 지금 가장 좋은 코딩 모델인가?
  • 그렇게 단정하기 어렵다. SpaceXAI의 자사 표에서 일부 장시간 작업 지표는 강하지만 모든 벤치마크에서 1위는 아니다. 실제 저장소와 독립 평가에서의 결과가 더 중요하다.
가격이 싸면 SpaceXAI에 무조건 유리한가?
  • 아니다. 낮은 가격은 채택을 빠르게 만들 수 있지만 추론 원가가 충분히 낮지 않으면 마진을 훼손한다. 사용량 성장과 단위당 원가를 함께 봐야 한다.
Fast 버전도 API에서 쓸 수 있나?
  • 현재 공식 문서상 Grok 4.7 Fast는 Cursor와 Grok Build 전용이며 공개 xAI API에서는 제공되지 않는다. 표준 Grok 4.7은 API에서 사용할 수 있다.
SpaceX 데이터가 Grok의 결정적 해자가 될까?
  • 가능성은 있지만 아직 검증되지 않았다. 데이터의 희소성보다 실제 학습효과, 정제 품질, 사용권한, 제품화가 더 중요하다.

체크 포인트

실제 개발자 사용량Cursor, API, 모델 라우터에서 Grok 4.7 호출량과 점유율이 올라가는지 본다. 벤치마크보다 실제 선택이 중요하다.
업무당 성공 비용재시도 횟수, 인간 검수시간, 장시간 작업 성공률이 개선되면 낮은 토큰 가격의 가치가 커진다.
추론 마진가격 인하가 사용량 확대보다 빠르면 매출은 늘어도 현금소모가 커질 수 있다. GPU와 전력 효율이 핵심이다.
엔터프라이즈 보안독립 안전성 평가, 감사 기능, 데이터 격리와 권한 통제가 실제 대기업 계약으로 연결되는지 확인한다.
Grok 5와 독점 데이터SpaceX 엔지니어링 데이터가 실제 기술·코딩 벤치마크와 제품 성능에서 반복 가능한 우위로 나타나는지가 가장 중요한 후속 검증이다.
모델 경쟁의 승부처가 벤치마크 점수에서 '업무 한 건을 끝내는 비용'으로 옮겨가고 있다.

인사이트 타임스 편집부