TL;DR
- 포화: 수학자들이 낸 연구 수준 문제 모음에서 AI가 97.6%를 찍었어요.
- 진짜 실력: 마지막 문제는 꼼수 없이 풀었다는 평가가 나왔어요.
- 새 시험: 아직 아무도 못 푼 문제를 냈더니 점수가 3%로 뚝 떨어졌어요.
"AI가 수학도 만점 수준이라던데, 이제 더 잴 게 남았나요?" 하는 분들께 답부터 드리면, 시험이 끝난 게 아니라 시험지가 바뀌었어요. 그 과정을 세 장면으로 짚어볼게요.
1️⃣ 5%에서 97.6%까지 14개월
AI 성능 측정 연구소 에포크 AI(Epoch AI)의 수학 시험 프론티어매스(FrontierMath) 4단계는 2025년 7월 공개 때 최고 점수가 5% 안팎이었어요. 2026년 6월 점검에서 문제 50개 중 12개를 고치고 7개를 빼 43문제가 됐는데, 오픈AI의 GPT-6 아스트라가 여기서 97.6%를 받았어요. 앞서 클로드 페이블 5는 90.2%, GPT-5.6 솔은 83.0%였고요.
2️⃣ 마지막 문제엔 지름길이 안 통했어요
그동안 수학자들은 AI가 문제의 의도를 비켜 가는 수치 계산 요령으로 답만 맞힌다고 지적해 왔어요. 마지막으로 풀린 문제는 조합론 수학자 제이 팬톤이 그런 요령을 막도록 만들었는데, 아스트라의 풀이가 출제자 본인의 풀이와 꽤 비슷했다고 해요.
3️⃣ 새 시험은 정답이 아직 없는 문제예요
에포크는 헝가리 수학자 폴 에르되시(Paul Erdős)가 남긴 미해결 문제 약 652개 중 수학자 토머스 블룸이 고른 68개로 새 시험을 만들었어요. 답은 린(Lean, 증명이 맞는지 컴퓨터가 자동으로 검사하는 언어)으로 써야 하고 문제당 300달러에 72시간이 한도예요. 결과는 아스트라만 2문제, 나머지 모델은 전부 0문제였어요.
📎 가격표
푼 2문제에 든 돈은 각각 222달러와 172달러, 시간은 10시간씩이에요. 예산을 훌쩍 늘려 5문제까지 풀어내는 데는 22만 달러 넘게 들었고, 정식 시험 한 번에는 2만 달러쯤 들었어요.
⚠️ 남는 단서
오픈AI의 풀이 하나는 18쪽짜리 글 증명이 린 코드 120만 줄로 불어났다고 해요. 또 나중에 나올 모델이 이미 공개된 풀이를 학습했을 가능성이 있어서, 에포크는 풀린 문제를 걸러내며 점수를 보정할 계획이라고 밝혔어요.
그래도 3번이 제일 중요해요. 점수가 만점에 붙으면 시험 문제가 바닥나서 더 어려운 시험이 시작된다는 뜻이라, 이 3%가 지금 AI 수학의 진짜 출발선이에요.

참고자료
'AI 리포트' 카테고리의 다른 글
| AI 해커 한 팀이 오픈AI 직원 계정을 뚫은 3가지 고리 (0) | 2026.09.22 |
|---|---|
| 글을 안 쓰는 AI 'Jev', 환각이 없다는 말은 어디까지 맞을까요? (0) | 2026.09.21 |
| 확장 프로그램 하나로 브라우저 AI 비서 5종이 조종당했다 (0) | 2026.09.20 |
| 폴더만 열었는데 코드가 실행된다, AI 코딩 에이전트 7종의 GitSpawn (0) | 2026.09.19 |
| 챗봇이 만든 허위 화물 보고서, 작전 직전에야 걸러진 이유는? (0) | 2026.09.19 |