AI가 수학을 본격적으로 풀기 시작했다. 그런데 진짜 놀라운 건 ‘정답’이 아니다

말을 잘하는 AI에서, 검증하고 탐색하고 발견하는 AI로. 수학과 과학에서 벌어지는 변화는 챗봇보다 훨씬 큰 이야기일 수 있다.

20초 핵심

1
AI가 수학 올림피아드에서 인간 최상위권 수준에 올라선 데 이어, 이제는 연구 수준의 수학 문제와 과학 문제를 풀기 시작했다.
2
핵심은 ‘똑똑해졌다’가 아니다. 답을 만들고, 틀린 길을 버리고, 증명을 검증하는 과정이 컴퓨터 안에서 반복되기 시작했다.
3
이 능력이 커지면 AI의 가장 큰 가치는 문서 작성이 아니라 신약, 반도체, 소프트웨어, 물리학처럼 ‘발견 비용이 비싼 분야’에서 나올 가능성이 있다.

챗GPT가 수학 문제를 잘 푸는 게 왜 대단한가

처음 들으면 좀 시큰둥할 수 있다.

“계산기보다 계산 잘하는 AI가 나온 것 아닌가?”

그런데 수학의 어려운 문제는 계산 문제가 아니다. 답이 뭔지도 모르고, 어디서 시작해야 할지도 모르는 상태에서 새로운 길을 찾아야 한다.

예를 들어 수학자는 어떤 명제가 참이라고 생각하면 그 이유를 수십 단계에 걸쳐 증명한다. 중간에 단 한 단계라도 틀리면 전체가 무너진다.

그래서 수학은 AI에게 묘한 시험장이다. 그럴듯하게 말하는 능력보다, 실제로 생각을 이어가고 틀린 길을 버리는 능력이 필요하다.

‘말 잘하는 AI’에서 ‘증명하는 AI’로

2024년 구글 딥마인드의 AlphaProof와 AlphaGeometry 2는 국제수학올림피아드 문제 6개 중 4개를 풀어 은메달 수준인 28점을 기록했다.

당시 AlphaProof가 사용한 핵심 도구 중 하나가 Lean이다.

Lean은 어렵게 생각할 필요 없다. 수학용 ‘검사기’에 가깝다. 사람이든 AI든 증명을 내놓으면 논리 한 칸 한 칸을 컴퓨터가 확인한다. 말이 멋있다고 넘어가주지 않는다. 틀리면 실패다.

1년 뒤 변화는 더 컸다. 2025년 Gemini Deep Think는 문제를 사람이 Lean으로 번역해주지 않아도 자연어 그대로 읽고 6문제 중 5문제를 풀어 35점, 금메달 수준을 기록했다.

그리고 2026년 10월 6일 OpenAI는 내부 프론티어 모델이 만든 여러 새로운 수학 결과와 함께, 상당수 증명의 Lean 형식화를 공개했다. 평균적으로 결과 하나를 얻는 데 약 3시간의 ChatGPT Pro급 추론 연산이 사용됐다고 밝혔다.

이제 AI가 수학에서 하는 일은 ‘정답 맞히기’와 조금 달라지고 있다. 여러 길을 탐색하고, 실패하고, 돌아가고, 다시 시도하고, 마지막에는 검증 가능한 형태로 답을 남기는 쪽으로 이동 중이다.

이게 왜 과학 전체의 이야기인가

과학의 상당 부분은 결국 ‘가능한 답이 너무 많은 문제’를 푸는 일이다.

단백질이 어떤 모양으로 접힐지, 어떤 분자가 약이 될지, 반도체 회로를 어떻게 배치해야 할지, 어떤 재료 조합이 더 강하고 가벼울지. 후보가 너무 많아서 사람이 전부 실험해볼 수 없다.

AI의 강점은 여기서 나온다. 사람이라면 평생 못 훑어볼 후보 공간을 엄청난 속도로 뒤지고, 가능성이 높은 것부터 실험 대상으로 좁힐 수 있다.

가장 유명한 사례가 AlphaFold다. 단백질의 3차원 구조를 예측하는 이 시스템은 2억 개가 넘는 단백질 구조 예측을 공개했고, 2025년 기준 190개국 이상의 300만 명 넘는 연구자가 사용했다.

이건 ‘AI가 과학자를 없앤다’는 얘기와 거리가 멀다. 오히려 과학자가 삽으로 땅을 파던 곳에 굴착기를 갖다주는 쪽에 가깝다.

더 흥미로운 장면은 AI가 자기 컴퓨터를 개선할 때 나온다

2025년 공개된 구글의 AlphaEvolve는 수학과 알고리즘 문제를 풀면서 실제 구글 데이터센터와 AI 시스템도 최적화했다.

구글은 AlphaEvolve가 데이터센터 자원의 평균 0.7%를 추가로 회수하는 스케줄링 방법을 찾아 실제 운영에 적용했고, Gemini 학습에 쓰이는 핵심 연산을 개선해 해당 커널을 23% 빠르게 만들었다고 밝혔다.

2026년에는 차세대 TPU 설계와 저장 시스템 최적화에도 활용됐다고 공개했다.

이 대목은 꽤 흥미롭다.

AI가 더 좋은 알고리즘을 찾고 → 그 알고리즘으로 컴퓨터가 더 효율적으로 움직이고 → 그 컴퓨터가 다시 더 강한 AI를 훈련한다.

아직 ‘AI가 스스로 폭발적으로 발전한다’고 말할 단계는 아니다. 하지만 도구가 자기 도구를 개선하기 시작했다는 점은 예전 챗봇 이야기와 성격이 다르다.

그럼 이제 과학자는 필요 없어질까

오히려 지금은 반대에 가깝다.

AI는 엄청난 속도로 후보를 만들 수 있지만, 무엇을 물어봐야 하는지 정하고, 결과가 실제 자연에서 맞는지 확인하고, 잘못된 전제를 찾아내는 일은 여전히 사람의 몫이 크다.

특히 수학과 과학에는 ‘검증됐다’와 ‘현실에서 쓸 수 있다’ 사이에 큰 간격이 있다.

수학적으로 멋진 알고리즘이 실제 공장에서 비용을 줄이지 못할 수도 있고, 컴퓨터가 찾은 신약 후보가 임상시험에서 실패할 수도 있다.

그래서 지금의 AI는 ‘자동 과학자’보다 ‘엄청나게 빠른 연구 파트너’라고 보는 편이 정확하다.

INSIGHT TIMES VIEW

AI를 이해할 때 챗봇 화면만 보면 변화가 작아 보인다.

문장을 조금 더 잘 쓰고, 코드를 조금 더 잘 짜고, 검색을 조금 더 잘하는 정도로 느껴질 수 있다.

하지만 수학과 과학에서는 다른 일이 벌어지고 있다.

AI가 사람 대신 답을 외우는 것이 아니라, 사람이 평생 다 탐색하기 어려운 문제 공간을 대신 뒤지고 있다.

그리고 Lean 같은 검증 도구가 붙으면 ‘그럴듯한 답’과 ‘검사 가능한 답’을 조금씩 구분할 수 있게 된다.

개인적으로는 이 지점이 AI의 장기 가치를 볼 때 꽤 중요한 기준이라고 본다.

앞으로 정말 큰 변화가 생긴다면, 가장 먼저 보이는 곳은 챗봇의 말투가 아니라 실험실, 연구실, 반도체 설계실일 가능성이 있다.

AI의 다음 승부는 말을 얼마나 사람처럼 하느냐보다, 인류가 아직 모르는 것을 얼마나 빨리 찾아내느냐에 가까워지고 있다.

AI가 수학 올림피아드를 잘 풀면 진짜 새로운 수학도 할 수 있나?
  • 이미 연구 수준의 문제에 접근하는 사례가 나오고 있다.
  • 다만 올림피아드 문제와 미해결 연구 문제는 난이도와 성격이 다르다. 둘을 같은 것으로 보면 과장이다.
Lean이 있으면 AI가 틀릴 수 없나?
  • 아니다.
  • Lean은 Lean 안에 정확하게 표현된 증명을 검사하는 데 강하다.
  • 문제 자체를 잘못 형식화했거나 현실 세계의 가정이 틀렸다면 별개의 문제다.
AI가 신약을 설계하면 동물실험이나 임상시험도 필요 없어지나?
  • 그렇지 않다.
  • AI는 후보를 빠르게 좁힐 수 있지만 실제 생물학적 효과와 안전성은 실험과 임상을 거쳐야 한다.
AI 과학에서 가장 큰 가치는 무엇일까?
  • ‘사람을 대체하는 것’보다 탐색 비용을 낮추는 데 있을 가능성이 크다.
  • 실패할 후보를 빨리 버리고, 실험할 가치가 높은 후보를 더 빨리 찾는 것. 이 차이가 연구개발의 시간과 비용을 크게 바꿀 수 있다.

체크 포인트

벤치마크 점수보다 새로운 수학 결과, 새로운 알고리즘, 실제 실험으로 이어지는 후보가 얼마나 나오는지 확인.
Lean 같은 형식 검증이나 자동 실험 시스템과 AI가 얼마나 깊게 결합하는지 확인.
신약, 소재, 반도체 설계에서 수개월 걸리던 작업이 실제로 며칠이나 몇 시간으로 줄어드는지가 핵심.
논문이나 데모를 넘어 데이터센터, 칩, 의약품, 공정에 실제 채택되는 사례가 늘어나는지 확인.

인사이트 타임스 편집부