TL;DR
- AI 환각은 성격 문제가 아니라 시험 채점 방식 문제예요
- "모른다"는 0점이라 확신 없어도 일단 찍는 거예요
- 채점 기준을 바꾸면 환각이 줄어든다는 게 오픈AI의 결론이에요
AI가 없는 얘기를 마치 진짜처럼 태연하게 말한 적, 다들 한 번쯤 있으시죠. 오픈AI가 이게 왜 생기는지 구조적인 이유를 밝혔어요.
📝 원인은 시험 채점 방식
지금 AI 평가 체계는 정답에만 점수를 주고 "모른다"는 답엔 0점을 줘요. 모델 입장에선 확신이 없어도 일단 찍는 게 이득인 구조인 거죠. 성실하게 모른다고 말하나 대충 찍으나 결과가 똑같으니까요.
📎 예시
맞춤법이나 문법처럼 규칙이 있는 건 AI가 잘 맞혀요. 근데 누군가의 생일처럼 무작위 정보는 애초에 맞히기 어려운데, 이럴 때도 "모른다"보다는 그럴듯하게 지어내는 쪽을 택하게 되는 거예요.
🎲 찍기를 막는 방법
오픈AI가 내놓은 해법은 간단해요. 확신에 찬 오답엔 더 큰 감점을 주고, "모른다"는 답엔 부분점수를 주는 거죠. 표준화 시험에서 무작정 찍기를 막으려고 오답 감점을 두는 것과 같은 원리예요.
📈 실제로 효과가 있었다
이 방식을 적용한 최신 모델은 추론 과정에서 환각 비율이 눈에 띄게 줄었다고 해요. 성격을 고친 게 아니라 채점표를 고친 거예요.
✅ AI 환각은 능력 문제가 아니라 채점 구조의 문제예요
✅ "모른다"에 0점을 주는 한 AI는 계속 찍을 수밖에 없어요
✅ 오답 감점 + 모른다 부분점수, 이 조합이 해법이었어요

참고자료
반응형
'AI 리포트' 카테고리의 다른 글
| AI 에이전트가 벤치마크 풀다가 진짜로 해킹을 저지른 4일 (0) | 2026.09.11 |
|---|---|
| 결제회사가 왜 AI 스타트업을 7조원에 샀을까 (0) | 2026.09.10 |
| AI 추론(Reasoning) 프로세스의 진화: 선형 알고리즘부터 브랜드별 아키텍처까지 (0) | 2026.09.09 |
| AI가 우리 몰래 세고 있던 것, '토큰'의 정체 (0) | 2026.09.08 |
| 이제 디자인도 마크다운(Markdown)으로 소통하는 시대 (0) | 2026.08.12 |