EXPLAIN테크

AI가 AI를 만드는 시대, 진짜 변화는 ‘연구공장’에서 시작됐다

Claude가 Anthropic AI R&D의 26%를 ‘주도’한다. 더 놀라운 숫자는 90%와 3만 개다. 최첨단 AI 연구소의 생산 방식이 인간 연구자 중심에서 인간이 방향을 정하고 대규모 AI 에이전트가 실행하는 구조로 빠르게 바뀌고 있다.

20초 핵심

1
2026년 8월 Anthropic의 자체 지표에서 Claude는 AI R&D 과업의 26%를 ‘Lead’ 단계로 수행했다. 2월에는 1% 미만이었다.
2
Claude가 협업 이상으로 관여한 과업은 90%를 넘었고, 가장 많이 쓰는 내부 플랫폼에서는 한 시점에 약 3만 개 에이전트가 연구와 엔지니어링 업무를 수행했다.
3
핵심 경쟁은 모델 점수만이 아니다. 연구 자동화 속도, 컴퓨팅과 전력, 검증 인프라, 에이전트 보안이 함께 새로운 병목으로 떠오르고 있다.

26%보다 더 중요한 것은, 연구조직의 형태가 바뀌고 있다는 점이다

Anthropic이 공개한 수치를 “Claude가 연구자의 26%를 대체했다”라고 읽으면 틀린다. 이 숫자는 근무시간이나 인원 감축률이 아니다. Anthropic은 약 1만5,000개의 세부 AI R&D 과업을 분류하고, 각 과업이 얼마나 자동화됐는지를 0단계부터 5단계까지 평가한 뒤 사람의 투입시간을 가중치로 사용해 R&D Automation Index를 만들었다.

그 결과 2026년 8월 기준 Claude가 고수준 지시를 받아 과업 대부분을 처음부터 끝까지 수행하고 사람이 감독하는 AL4, ‘AI Leads’에 해당하는 업무가 26%였다. 완전히 인간 개입 없이 수행하는 AL5는 측정된 업무에서 아직 없었다. 반면 AL3, 즉 사람과 협업하는 단계 이상까지 넓히면 비중은 90%를 넘었다.

26%Claude가 ‘Lead’ 수준으로 수행한 AI R&D 과업 비중
90%+Claude가 ‘Collaborate’ 이상으로 관여한 과업 비중
~3만가장 많이 쓰는 내부 플랫폼에서 한 시점에 활동한 연구·엔지니어링 에이전트
10억+2026년 8월 온라인 모니터가 검사한 에이전트 의사결정

숫자를 읽을 때의 주의점

26%는 회사 전체 업무의 26%가 아니며, ‘AI R&D’ 과업에 대한 자체 지수다. 약 3만 개 역시 Anthropic 전체 시스템의 총 에이전트 수가 아니라 가장 많이 쓰는 내부 플랫폼에서 한 시점에 활동한 규모다. 이 정의를 빼면 숫자는 실제보다 훨씬 과장돼 보일 수 있다.

영화 속 ‘자기개선’보다 현실적인 모습은 반자동 연구공장이다

재귀적 자기개선은 흔히 AI가 혼자 다음 세대 AI를 설계하고 스스로 더 똑똑해지는 장면으로 묘사된다. Anthropic의 현재 모습은 그 단계가 아니다. 더 정확한 표현은 인간이 연구 방향을 정하고, 대규모 에이전트가 실행량을 폭발적으로 늘리는 반자동 연구공장이다.

인간이 연구 목표와 제약조건을 설정한다
AI 에이전트가 코드 작성, 실험, 디버깅, 평가, 분석을 대규모로 수행한다
자동 모니터와 인간이 결과와 행동을 검증한다
모델, 도구, 데이터와 실험환경이 개선된다
더 강한 모델이 다음 연구 사이클에서 더 많은 업무를 맡는다

이 구조에는 이미 ‘재귀성’이 있다. AI가 연구자의 생산성을 높이면 다음 모델을 더 빨리 만들 수 있고, 더 강해진 모델이 다시 연구 자동화를 높인다. 중요한 것은 AI가 연구 방향을 완전히 독자적으로 정하느냐가 아니라, 한 세대에서 다음 세대로 넘어가는 개발 주기가 얼마나 압축되느냐다.

생산성이 20% 높아지는 것과 개발 사이클이 절반으로 줄어드는 것은 산업적으로 전혀 다르다. 후자가 반복되면 모델 성능, 컴퓨팅 수요, 자본지출, 제품 출시 속도가 서로를 밀어 올리는 비선형적 경쟁이 시작될 수 있다.

AI가 빨라질수록 희소해지는 것은 ‘검증’이다

Anthropic의 내부 플랫폼에서는 2026년 8월 한 시점에 약 3만 개 에이전트가 동시에 연구와 엔지니어링 업무를 수행했다. 이들의 행동은 실행 전에 온라인 모니터를 거쳤고, 한 달 동안 10억 건이 넘는 의사결정 가운데 0.002%, 약 4만7,000건당 1건이 차단됐다.

0.002%는 작아 보이지만 10억 건 기준으로는 대략 2만 건 수준이다. 더 중요한 것은 차단률 자체가 안전성 합격률이 아니라는 점이다. 에이전트가 실제로 안전했기 때문에 낮을 수도 있고, 권한이 제한돼 위험한 행동이 적었기 때문일 수도 있다. 반대로 모니터가 놓친 행동이 있다면 낮은 차단률은 안심할 근거가 되지 못한다.

앞으로 봐야 할 안전 지표왜 중요한가
모니터 탐지율과 false negative차단률보다 ‘놓친 위험 행동’이 실제 감독 품질을 더 잘 보여준다.
권한 수준별 실패율파일 읽기, 코드 실행, 네트워크 접근, 자격증명 사용 등 권한이 커질수록 위험의 성격이 달라진다.
사후 발견된 오류와 사고실행 전에 잡지 못한 문제가 실제 운영환경에서 얼마나 남는지 확인할 수 있다.
인간 검토까지 걸리는 시간에이전트의 속도가 인간 감사 능력을 추월하는지 보여준다.
모델 버전별 위험 변화성능 향상이 감독 가능성까지 함께 높이는지, 오히려 낮추는지 확인할 수 있다.

안전 컴퓨팅 6%와 12%는 시작점이지 결론이 아니다

Anthropic은 2026년 7월 13일부터 20일까지 한 주를 표본으로 분석했다. 이 기간 AI R&D에 사용된 컴퓨팅 가운데 약 6%가 안전 관련 업무에 배정됐고, AI가 주도하는 AI R&D 컴퓨팅만 보면 약 12%였다. 회사는 역량 향상과 안전에 동시에 기여한 작업을 안전으로 잡지 않았기 때문에 보수적 추정치라고 설명한다.

다만 이 비율을 “R&D 예산의 6%가 안전에 쓰였다”라고 읽어서도 안 된다. 안전 연구는 사람의 설계 시간이 길고 실제 계산량은 작을 수 있어 컴퓨팅 비중이 투자 우선순위를 완전히 대변하지 못한다. 따라서 더 중요한 질문은 돈이나 GPU 비율 하나가 아니라 투입 → 탐지 → 통제 → 독립 검증의 전 과정이 작동하는가다.

Anthropic이 외부 독립 평가자에게 내부 위험평가팀에 준하는 시스템과 데이터 접근권을 제공하겠다고 밝힌 이유도 여기에 있다. 에이전트가 실제 내부 도구와 권한을 사용하며 일하는 시대에는 공개 벤치마크만으로 운영 위험을 충분히 확인하기 어렵다.

이 변화가 AI 산업의 돈 흐름을 바꾸는 방식

AI가 AI 연구를 가속한다면 수요는 학습용 GPU 하나로 끝나지 않는다. 에이전트는 코드를 쓰고, 실험을 반복하고, 결과를 읽고, 다시 실행한다. 이는 학습 이후의 추론 컴퓨팅을 크게 늘릴 수 있다. 메모리 대역폭, 네트워킹, 스토리지, 데이터센터 전력과 냉각까지 연구 자동화의 일부가 된다.

보안 산업의 역할도 달라진다. 수만 개 에이전트에 업무 권한을 부여하면 AI 보안은 콘텐츠 필터링이 아니라 신원관리, 최소권한, 샌드박스, 네트워크 통제, 행동 모니터링, 감사 로그와 사고 대응의 문제가 된다. 기업 소프트웨어 역시 ‘직원 한 명에게 AI 도구 하나를 주는 방식’보다 업무 프로세스 자체를 에이전트가 수행 가능한 단위로 재설계하는 쪽에서 더 큰 생산성 격차가 생길 가능성이 있다.

투자 관점에서는 여기서 한 단계 더 조심할 필요가 있다. Anthropic 한 회사의 내부 운영지표가 곧바로 전체 AI 산업의 컴퓨팅 수요 곡선을 의미하지는 않는다. 그러나 여러 프런티어 연구소에서 R&D 자동화율이 같은 방향으로 상승한다면, AI 인프라 수요를 추정할 때 모델 학습 횟수뿐 아니라 ‘AI가 AI 연구를 위해 소비하는 추론량’을 별도 변수로 봐야 한다.

INSIGHT TIMES VIEW

이번 공개에서 가장 중요한 숫자는 26% 하나가 아니다. 2월 1% 미만이었던 ‘AI Lead’ 비중이 8월 26%로 올라왔고, 90%가 넘는 AI R&D 과업에 Claude가 협업 이상으로 들어갔다는 속도 자체가 핵심이다.

다만 이 데이터는 Anthropic이 자체 모델로 내부 기록을 분석해 만든 지표다. 회사도 교차 기업 비교를 가로막는 공통 방법론 부재와 ‘Claude가 Claude를 평가하는’ 문제를 인정한다. 내부 담당자와 모델의 자동화 단계 판정은 정확히 일치한 경우가 59%였고, 한 단계 이내 일치는 97%였다. 방향은 강한 신호지만 숫자를 절대적인 생산성 측정치로 읽어서는 안 된다.

현재로서는 이렇게 보는 편이 가장 합리적이다. AI가 인간 연구자를 없애고 있는 것이 아니라, 한 명의 연구자가 훨씬 더 많은 디지털 노동력을 지휘할 수 있게 만들고 있다. 이 구조가 다른 연구소에서도 재현된다면 미래의 AI 경쟁력은 모델 성능만이 아니라 모델 능력, 에이전트 운영, 컴퓨팅과 전력, 검증 인프라, 안전 거버넌스의 결합으로 이동할 가능성이 높다.

Claude가 Anthropic 연구개발의 26%를 한다는 뜻인가?
  • 정확히는 아니다. AI R&D 업무를 세부 과업으로 나누고 자동화 수준을 평가한 지수에서 26%가 ‘AI Leads’ 단계로 분류됐다는 뜻이다. 사람 수, 근무시간, 전체 회사 업무의 26%와 동일하지 않다.
그렇다면 재귀적 자기개선은 이미 시작된 것인가?
  • 좁은 의미의 완전한 RSI, 즉 AI가 인간 개입 없이 후속 모델을 만드는 단계는 아니다. Anthropic도 측정된 과업 가운데 AL5 완전 자율은 없다고 밝혔다. 다만 더 강한 AI가 다음 AI 개발 속도를 높이는 피드백 루프는 이미 형성되고 있다.
3만 개 에이전트는 3만 명의 연구자를 대체했다는 뜻인가?
  • 아니다. 에이전트는 과업 단위로 생성되고 병렬 실행될 수 있어 사람과 1대1로 대응하지 않는다. 더 적절한 해석은 한 명의 연구자가 동시에 훨씬 많은 작업을 위임할 수 있는 디지털 노동력이 생겼다는 것이다.
0.002%만 차단됐다면 시스템이 거의 안전하다는 뜻 아닌가?
  • 그렇게 결론내릴 수 없다. 이 수치는 온라인 모니터가 차단한 비율이다. 모니터가 위험 행동을 얼마나 놓치는지, 권한이 얼마나 제한돼 있었는지, 실행 뒤 발견된 사고가 있었는지를 함께 봐야 한다.
투자자는 가장 먼저 어떤 기업을 봐야 하나?
  • 특정 종목 하나보다 수요의 연결고리를 보는 편이 낫다. 연구 자동화가 실제로 추론량을 크게 늘리는지, 그 결과 가속기, HBM, 네트워크, 스토리지, 데이터센터 전력과 보안 지출이 동반 증가하는지를 확인해야 한다. Anthropic의 한 번의 공개만으로 장기 수요를 단정하기는 이르다.

체크 포인트

AI Lead 비중26%가 다음 측정에서 계속 빠르게 올라가는지 본다. 상승 속도가 유지되면 연구 자동화의 복리 효과에 대한 근거가 강해진다.
AL5, 완전 자율 과업의 등장 현재는 0%다. 인간 감독 없이 완료되는 측정 과업이 나타나면 ‘보조 도구’와 ‘자율 연구자’ 사이의 경계가 실제로 움직이기 시작한 것이다.
에이전트 결정량과 컴퓨팅 사용량 업무 자동화율과 함께 추론량이 얼마나 증가하는지 봐야 AI 연구 자동화가 인프라 수요에 미치는 영향을 추정할 수 있다.
모니터의 false negative 0.002% 차단률보다 더 중요하다. 놓친 위험 행동이 늘어난다면 자동화 속도가 감독 능력을 추월한다는 뜻이 될 수 있다.
외부 검증과 공통 지표 OpenAI, Google DeepMind, Meta 등 다른 연구소가 같은 정의로 수치를 공개해야 Anthropic의 26%를 산업 전체 추세로 읽을 수 있다.
AI가 연구자를 없애는 게 아니라, 한 연구자가 지휘하는 디지털 노동력이 늘어나고 있다.

인사이트 타임스 편집부