본문 바로가기
AI 리포트

AI한테 지우라고 한 정보, 단어를 다르게 쪼개면 돌아와요

by 스킬사공사 2026. 9. 28.

TL;DR

  • 발견: 모델에서 지운 지식이, 같은 문장을 다른 토큰 조각으로 넣으면 되살아나요.
  • 수치: 다른 방식으로 쪼갠 입력의 평균 38.6%가 수정을 비껴갔어요.
  • 의미: 부분 수정만으로 "지웠다"고 말하긴 아직 이르다는 경고예요.

"그 정보는 모델에서 지웠습니다." 이 말, 앞으로는 한 번 더 확인해야 할지도 몰라요. 9월 24일 공개된 논문 하나가 지운 기억이 어떤 뒷문으로 새어 나오는지 보여줬거든요.

🧽 지웠다는 건 어떻게 지운 걸까

AI 모델에서 특정 사실만 콕 집어 고치는 걸 지식 편집, 아예 잊게 만드는 걸 머신 언러닝(이미 학습된 정보를 모델에서 걷어내는 기술)이라고 불러요. 요즘 많이 쓰는 건 "찾아서 고치기" 방식이에요. 그 사실이 저장된 층을 추적한 뒤, 그 부분 가중치만 살짝 바꾸는 거죠.

문제는 이 추적을 할 때 문장을 늘 표준 방식 한 가지로만 쪼갠다는 점이에요.

🧩 같은 문장, 다른 조각

AI는 글을 토큰(모델이 한 번에 읽는 글자 조각)으로 잘라서 읽어요. 그런데 똑같은 문장도 자르는 방법은 여러 가지예요.

📎 예시

"The phone number of John Doe is"를 표준대로 자르면 phone num + ber처럼 나뉘어요. 이걸 phon + e nu + mber로 잘라도 화면에 보이는 글자는 완전히 같아요. 하지만 모델 안에서는 전혀 다른 계산 길을 타요.

수정은 표준 길에만 걸려 있으니, 샛길로 들어온 입력은 옛 기억을 그대로 꺼내 오는 거예요.

🔬 연구진이 확인한 것

싱가포르국립대와 싱가포르 과학기술연구청(정부 산하 연구기관, 영문 약칭 에이스타) 연구진은 이 샛길 공격에 Toketive라는 이름을 붙였어요. 라마3, OLMo2 등 모델 5종과 MEMIT, AlphaEdit 등 편집·언러닝 기법 6가지에 시험해 봤더니 결과가 꽤 뚜렷했어요. 수정 전 원래 답을 상위 5개 후보 기준 74.5% 정확도로 되살려냈거든요.

⚠️ 주의

이 공격은 모델 가중치와 내부 값을 들여다볼 수 있어야 해요. 그래서 가중치를 통째로 공개하는 오픈 웨이트 모델에서 특히 현실적인 위험이에요.

🛠️ 막을 방법은 없을까

연구진은 찾아낸 샛길까지 넣어서 반복 수정하는 방법도 시험했어요. 우회율은 32%에서 4%로 뚝 떨어졌어요. 대신 건드리지 말아야 할 주변 지식까지 바뀌는 부작용이 1.0배에서 8.6배로 불어났어요. 한쪽 구멍을 틀어막을수록 옆 벽이 흔들리는 셈이에요.

✅ 부분 수정한 모델은 "지웠다"보다 "가렸다"에 가까울 수 있어요.
✅ 언러닝 결과는 표준 입력뿐 아니라 다른 토큰 조합으로도 찔러봐야 해요.
✅ 민감한 정보는 애초에 학습 데이터에 넣지 않는 게 여전히 제일 확실해요.

출처

반응형