AI 비용 통제 노하우! 모델보다 ‘배치 순서’에서 갈린다
ChatGPT와 Claude를 아끼는 가장 좋은 방법은 싼 모델만 고집하는 것이 아니다. 쉬운 일은 가볍게 처리하고, 질문을 먼저 정교하게 만든 뒤, 돈과 시간, 보안에 실제 손실이 생길 수 있는 마지막 단계에만 강한 모델과 높은 reasoning을 쓰는 것이다.

20초 핵심
1. Claude와 ChatGPT 모두 ‘사다리’로 쓰면 된다
| 역할 | Claude | ChatGPT | 적합한 작업 |
|---|---|---|---|
| 빠른 기본 작업 | Haiku 4.5 | Instant | 추출, 분류, 제목 후보, 간단한 정리, 빠른 질의 |
| 일상 업무 기본값 | Sonnet 5.5 Medium | GPT-5.6 Sol Medium | 번역, 실적 요약, 글쓰기, 일반 코딩, SQL 초안 |
| 복잡한 분석 | Sonnet High / Opus Medium | GPT-5.6 Sol High | 여러 자료 종합, 투자 가설 분석, 복잡한 디버깅 |
| 고비용 최종 검증 | Opus High / Fable 5.1 | GPT-5.6 Sol Pro / GPT-6 Pro | 반박 검증, 장시간 워크플로, 중요한 보안·금융 판단 |
OpenAI의 현재 구조도 Claude와 크게 다르지 않다. GPT-5.6 Sol은 Instant, Medium, High, Extra High로 reasoning 강도를 조절할 수 있고, 더 어려운 작업에는 GPT-5.6 Sol Pro와 GPT-6 Pro가 별도 상위 선택지로 제공된다. 따라서 ChatGPT에서도 처음부터 Pro를 고르는 것보다 Instant 또는 Medium에서 시작해 필요할 때 올라가는 방식이 합리적이다.
2. Effort와 reasoning은 한 칸씩 올린다
Claude의 Effort와 ChatGPT의 Thinking slider는 같은 질문에 얼마나 많은 추론 자원을 쓸지 정하는 장치다. 쉬운 작업에서는 기본 단계가 비용과 속도 면에서 유리하고, 숫자와 인과관계가 복잡해질수록 한 단계 높은 설정이 유리하다.
중요한 것은 “끝까지 같은 모델을 쥐어짜기”가 아니다. Sonnet High로도 불안하면 Opus Medium으로, GPT-5.6 Sol High로도 결과가 흔들리면 Pro 계열로 올라가는 방식이 낫다. 모델 급을 올릴 때는 정확도 향상이 재작업 비용을 줄이는지까지 함께 봐야 한다.
3. 답이 나쁘면 모델보다 질문을 먼저 의심한다
“엔비디아 실적 분석해줘”처럼 범위가 넓은 질문은 어느 서비스에서도 낭비가 크다. 모델이 무엇을 중요하게 볼지부터 스스로 결정해야 하기 때문이다.
대신 무엇을 볼지, 어떤 기준으로 해석할지, 어떤 형식으로 받을지를 고정하면 기본 모델에서도 결과가 훨씬 안정된다. 예를 들어 “데이터센터 매출, 총이익률, 다음 분기 가이던스, 주요 고객 수요를 보고 사실과 해석을 분리해 표 1개와 결론 5개로 정리”처럼 범위를 지정하는 방식이다.
좋은 프롬프트는 더 좋은 모델을 대신하지는 못하지만, 상위 모델로 올라가야 하는 빈도를 줄인다. AI 비용을 줄이는 첫 번째 레버는 모델 선택이 아니라 질문 설계다.
4. 비싼 모델은 ‘틀리면 손해가 큰 단계’에만 쓴다
테슬라 실적을 분석한다면 Claude든 ChatGPT든 처음부터 최고 모델을 쓸 이유는 없다. 1단계에서 매출, 자동차 마진, 에너지, FCF, CapEx, 가이던스를 추출하고, 2단계에서 지난 8분기와 비교한다. 3단계에서 가설을 해석하고, 마지막 4단계에서만 상위 모델을 불러 기존 결론을 가장 강하게 반박하게 하는 편이 효율적이다.
코딩도 같다. 로그 정리, 원인 후보, 재현 코드는 기본 모델로 처리하고, 실제 RLS 정책, 인증, 결제 로직을 바꾸기 직전에 Opus 또는 GPT Pro 계열로 보안 검증을 수행하는 편이 낫다. 비싼 모델의 역할은 모든 일을 대신하는 것이 아니라 실패 비용이 큰 지점의 오류 확률을 낮추는 것이다.
5. 사용량을 태우는 주범은 ‘길이와 도구’다
Claude는 대화 길이와 복잡성, 모델, Effort, 웹 검색과 커넥터 사용에 따라 소모량이 달라진다. ChatGPT Work와 Codex도 마찬가지다. OpenAI는 실제 사용량이 모델, 작업 실행 위치, 복잡성, 컨텍스트, reasoning, 속도, 도구 사용에 따라 달라지며, 장시간 작업은 짧은 요청보다 훨씬 많은 allowance를 사용할 수 있다고 안내한다.
따라서 양쪽 모두 공통된 절약 습관이 통한다. 주제별 채팅 분리, 오래된 시행착오를 요약한 뒤 새 채팅으로 이동, 필요 없는 검색과 커넥터 비활성화, 큰 파일을 무작정 여러 번 넣지 않는 방식이다.
같은 문제를 오래 다룬다고 같은 채팅을 끝까지 유지하는 것이 항상 효율적인 것은 아니다. 초반에는 과거 맥락이 도움이 되지만, 시간이 지나면서 실패한 시도, 폐기된 가설, 수정 전 코드와 오래된 숫자가 쌓이면 모델이 새 질문을 받을 때 불필요한 정보까지 함께 처리해야 할 수 있다. 이때는 기존 채팅에서 “현재 목표, 확정된 사실, 이미 배제된 가설, 현재 상태, 다음 작업”만 짧게 요약한 뒤 새 채팅에 복사해 이어가는 편이 효율적이다. 5만 토큰짜리 긴 맥락 대신 5천 토큰짜리 인수인계 요약으로 시작한다면 실제 과금이 정확히 90% 줄어든다는 뜻은 아니지만, 모델이 처리해야 할 입력 맥락 자체는 대략 10분의 1 수준으로 줄어들 수 있다. 즉 새 채팅은 기억을 버리는 것이 아니라, 필요한 기억만 압축해 다시 시작하는 작업에 가깝다.
Project도 마법의 무료 저장소는 아니다. 자료를 반복 관리하는 데는 매우 유리하지만, 실제 추론에 들어간 컨텍스트는 결국 비용과 사용량에 영향을 준다. “자료를 저장하는 것”과 “모델이 그 자료를 읽고 생각하는 것”은 분리해서 봐야 한다.
6. Claude와 ChatGPT의 ‘한도 시계’는 서로 다르다
Claude Max는 5시간 단위 세션 한도와 주간 한도를 함께 운용한다. 여러 Claude 표면의 사용량이 같은 풀에 반영될 수 있고, 포함 사용량을 소진한 뒤 usage credits를 켜면 추가 비용이 발생한다.
ChatGPT는 일반 Chat과 Work·Codex를 구분해서 봐야 한다. 일반 Chat의 GPT-5.6 reasoning 및 Pro 모델은 각 플랜의 모델별 allowance를 따르고, Work와 Codex는 별도의 agentic allowance 체계를 사용한다. Plus와 Pro에서는 Work와 Codex, 지원되는 일부 에이전트 기능이 같은 agentic usage pool과 credits를 공유할 수 있다.
Work와 Codex는 고정된 메시지 수 개념이 아니다. OpenAI는 사용량이 모델, 입력과 출력 길이, reasoning 수준, 도구, 작업 복잡도에 따라 달라진다고 설명한다. 일부 플랜에서는 5시간 창과 주간 창이 함께 적용될 수도 있다. 따라서 “ChatGPT는 몇 회 쓸 수 있나”보다 Settings → Usage에서 실제 allowance와 reset 시간을 확인하는 것이 더 정확하다.
7. 서비스별 실전 절약 운영법
기본은 Sonnet, 승부처는 Opus
Haiku로 반복 작업을 덜고, Sonnet Medium을 기본값으로 사용. 분석이 어려워지면 High, 그다음 Opus. Fable은 최상단 예외 처리용.
기본은 Instant·Medium, 어려울 때 High
빠른 질의는 Instant, 일반 분석은 Medium. 복잡한 투자 분석과 코딩은 High. 장시간 고난도 작업이나 최종 검증에서만 Pro 모델 또는 Work 활용.
에이전트 작업은 컨텍스트 관리
긴 세션이 누적되면 과거 시행착오가 비용을 키움. 확정된 결정과 남은 문제를 요약한 뒤 새 세션으로 넘어가는 방식이 효율적.
멀티스텝 작업은 일괄 위임할 때만
단순 질문에 Work를 쓰기보다, 여러 파일과 웹, 코딩, 결과물 제작이 이어지는 작업에서 사용. Work와 Codex는 같은 agentic allowance를 공유할 수 있다는 점 확인.
AI 절약의 본질은 싼 모델을 쓰는 것이 아니라 비싼 판단을 어디에 배치하느냐다.
Claude든 ChatGPT든 가장 좋은 운영법은 비슷하다. 먼저 질문을 정교하게 만든다. 기본 모델에서 추출과 구조화를 끝낸다. 필요하면 reasoning을 한 단계 올린다. 그래도 결과가 흔들리고, 틀렸을 때 돈과 시간, 보안에 실제 손실이 생기는 단계에서만 상위 모델을 투입한다.
결국 비용을 가르는 것은 모델명이 아니라 작업을 어떤 순서로 쪼개고, 어디에 가장 비싼 추론을 쓰느냐 다.
- 빠른 질의에는 유리하지만 복잡한 문제에서 재질문과 수정이 반복되면 총비용이 오를 수 있다. 일반 분석은 Medium, 어려운 문제는 High로 한 단계씩 올리는 편이 안정적이다.
- 단순 분류와 추출은 Haiku가 더 효율적일 수 있다. 반대로 처음부터 복잡한 판단이 핵심이라면 Opus로 바로 가는 편이 재작업을 줄일 수 있다.
- 아니다. 일반 Chat의 모델 allowance와 Work·Codex의 agentic allowance는 구분해서 봐야 한다. Work와 Codex는 지원되는 플랜에서 같은 agentic pool을 공유할 수 있다.
- 상위 모델보다 불필요한 컨텍스트와 도구 호출이다. 긴 대화를 정리하고, 필요 없는 웹 검색과 커넥터를 끄는 것부터 시작하는 편이 체감 효과가 크다.
체크 포인트
인사이트 타임스 편집부





