TL;DR
- 텍스트도 결국 숫자놀음: AI는 글자가 아니라 잘게 쪼갠 '토큰'을 세면서 값을 매겨요
- 한국어라서 은근 억울함: 조사가 많은 한국어는 같은 말을 해도 토큰이 훌쩍 더 나가요
- 안 보인다고 공짜 아님: '생각하는 AI'의 머릿속 잡생각까지 전부 청구서에 찍혀요
AI가 척척 대답 잘해주길래 거의 공짜인 줄 알았는데, 어느 날 청구서 보고 놀란 적 있으세요? 사실 AI는 우리가 던진 말 한 마디를 전부 잘게 쪼개서 세고 있었어요. 그 조각이 바로 '토큰'이고, 젠슨 황이 이걸 굳이 'AI의 통화'라고 부른 이유를 풀어볼게요.
🔍 토큰이 뭔데
사람은 "다크니스"를 통째로 읽지만, AI는 이걸 "dark"랑 "ness"로 뚝 잘라서 각각 번호표를 붙여요. 화면엔 문장으로 보여도 AI 입장에선 그냥 숫자 나열이에요.
💡 Tip
"darkness"는 dark(217)와 ness(655)로 쪼개지는데, 재밌게도 "brightness"를 쪼개면 bright와 ness로 나뉘면서 이 ness 토큰을 그대로 재사용해요. 완전히 다른 단어인데 조각 하나는 이미 있던 걸 그대로 갖다 쓰는 거죠.
🇰🇷 한국어라서 손해 보는 이유
영어로 짧게 끝날 말도 한국어로 옮기면 토큰이 3~5배로 불어나요. 토크나이저 자체가 영어 위주로 짜여 있다 보니, 조사가 붙는 순간마다 쪼갤 지점이 하나씩 더 생겨버리거든요.
📎 예시
"학교에"는 "학교"와 "에"로 쪼개지고, "먹었어요"도 어간과 어미가 따로따로 잘려요. 이렇게 조각이 계속 늘어나다 보니 '기생충'을 설명하는 한국어 한 문단이 일반 토크나이저로는 103개 토큰인데, 한국어 전용 토크나이저로는 47개 토큰이면 끝나요. 거의 반 토막이죠.
단어에 번호를 뭐야?
"darkness"는 dark(217)와 ness(655)로 쪼개지는데, 재밌게도 "brightness"를 쪼개면 bright와 ness로 나뉘면서 이 ness 토큰을 그대로 재사용해요. 완전히 다른 단어인데 조각 하나는 이미 있던 걸 그대로 갖다 쓰는 거죠. 이게 가능한 이유는 토크나이저가 미리 방대한 텍스트를 학습하면서 자주 같이 붙어 나오는 조각들을 사전처럼 정리해두고, 조각마다 고정된 번호를 매겨놨기 때문이에요. 그래서 어떤 단어에서 나오든 "ness"라는 조각은 항상 655번으로 불려요.
🧠 안 보인다고 공짜는 아니다
'생각하는 AI'는 답을 내놓기 전 머릿속으로 이것저것 따져보는데, 그 과정도 전부 토큰으로 세서 청구돼요. 대화가 길어질수록 예전 대화까지 매번 다시 계산에 끼워 넣고요.
⚠️ 주의
화면엔 세 줄만 떠도 뒤에서 몇 천 토큰을 썼을 수 있어요. 반복되는 프롬프트는 캐싱해두면 입력 비용을 최대 90%까지 아낄 수 있어요.
✅ 토큰 = AI 요금이 매겨지는 최소 단위
✅ 한국어는 구조상 토큰 소비에 불리함
✅ 캐싱 + 필요할 때만 추론 모드 = 방어 전략
'AI 리포트' 카테고리의 다른 글
| AI는 왜 모른다고 말 못할까 (0) | 2026.09.09 |
|---|---|
| AI 추론(Reasoning) 프로세스의 진화: 선형 알고리즘부터 브랜드별 아키텍처까지 (0) | 2026.09.09 |
| 이제 디자인도 마크다운(Markdown)으로 소통하는 시대 (0) | 2026.08.12 |
| AI 넌 누구냐? (0) | 2026.08.06 |
| AI를 잘 쓰는 사람"이 아니라 "AI를 비즈니스에 적용할 수 있는 사람" (0) | 2026.08.04 |