TL;DR
- 발견: 모델에서 지운 지식이, 같은 문장을 다른 토큰 조각으로 넣으면 되살아나요.
- 수치: 다른 방식으로 쪼갠 입력의 평균 38.6%가 수정을 비껴갔어요.
- 의미: 부분 수정만으로 "지웠다"고 말하긴 아직 이르다는 경고예요.
"그 정보는 모델에서 지웠습니다." 이 말, 앞으로는 한 번 더 확인해야 할지도 몰라요. 9월 24일 공개된 논문 하나가 지운 기억이 어떤 뒷문으로 새어 나오는지 보여줬거든요.
🧽 지웠다는 건 어떻게 지운 걸까
AI 모델에서 특정 사실만 콕 집어 고치는 걸 지식 편집, 아예 잊게 만드는 걸 머신 언러닝(이미 학습된 정보를 모델에서 걷어내는 기술)이라고 불러요. 요즘 많이 쓰는 건 "찾아서 고치기" 방식이에요. 그 사실이 저장된 층을 추적한 뒤, 그 부분 가중치만 살짝 바꾸는 거죠.
문제는 이 추적을 할 때 문장을 늘 표준 방식 한 가지로만 쪼갠다는 점이에요.
🧩 같은 문장, 다른 조각
AI는 글을 토큰(모델이 한 번에 읽는 글자 조각)으로 잘라서 읽어요. 그런데 똑같은 문장도 자르는 방법은 여러 가지예요.
📎 예시
"The phone number of John Doe is"를 표준대로 자르면 phone num + ber처럼 나뉘어요. 이걸 phon + e nu + mber로 잘라도 화면에 보이는 글자는 완전히 같아요. 하지만 모델 안에서는 전혀 다른 계산 길을 타요.
수정은 표준 길에만 걸려 있으니, 샛길로 들어온 입력은 옛 기억을 그대로 꺼내 오는 거예요.
🔬 연구진이 확인한 것
싱가포르국립대와 싱가포르 과학기술연구청(정부 산하 연구기관, 영문 약칭 에이스타) 연구진은 이 샛길 공격에 Toketive라는 이름을 붙였어요. 라마3, OLMo2 등 모델 5종과 MEMIT, AlphaEdit 등 편집·언러닝 기법 6가지에 시험해 봤더니 결과가 꽤 뚜렷했어요. 수정 전 원래 답을 상위 5개 후보 기준 74.5% 정확도로 되살려냈거든요.
⚠️ 주의
이 공격은 모델 가중치와 내부 값을 들여다볼 수 있어야 해요. 그래서 가중치를 통째로 공개하는 오픈 웨이트 모델에서 특히 현실적인 위험이에요.
🛠️ 막을 방법은 없을까
연구진은 찾아낸 샛길까지 넣어서 반복 수정하는 방법도 시험했어요. 우회율은 32%에서 4%로 뚝 떨어졌어요. 대신 건드리지 말아야 할 주변 지식까지 바뀌는 부작용이 1.0배에서 8.6배로 불어났어요. 한쪽 구멍을 틀어막을수록 옆 벽이 흔들리는 셈이에요.
✅ 부분 수정한 모델은 "지웠다"보다 "가렸다"에 가까울 수 있어요.
✅ 언러닝 결과는 표준 입력뿐 아니라 다른 토큰 조합으로도 찔러봐야 해요.
✅ 민감한 정보는 애초에 학습 데이터에 넣지 않는 게 여전히 제일 확실해요.

출처
'AI 리포트' 카테고리의 다른 글
| AI가 2005년부터 안 풀리던 암호문을 이틀 만에 풀었대요 (1) | 2026.09.27 |
|---|---|
| "이 대화, 이미 뚫렸다" AI가 스스로 심은 탈옥 명령, 27번 나왔어요 (0) | 2026.09.27 |
| 예전엔 벤치마크 점수부터 믿었는데, 이제는 채점표부터 의심해요 (0) | 2026.09.25 |
| AI 코딩 에이전트 4종, "고정해둔 버전"이 사실은 안 고정돼 있었어요 (0) | 2026.09.24 |
| AI 해커 한 팀이 오픈AI 직원 계정을 뚫은 3가지 고리 (0) | 2026.09.22 |