본문 바로가기
PM 인사이트

AI-Ready Data : AI 쓰기 전에 데이터부터 준비됐는지 물어봐야 하는 이유

by 스킬사공사 2026. 9. 9.

TL;DR

  • AI 도입이 삐걱대는 건 대부분 모델이 아니라 데이터·지식 준비 부족 때문이에요
  • 핵심은 "분류 → 정제 → 권한통제 → 추적 → 안전한 AI 연결"이라는 흐름이에요
  • 처음부터 크게 벌이지 말고, 관리 가능한 파일럿 하나부터 시작하는 게 좋아요

"회사에 AI 붙였는데 왜 이렇게 헛다리를 짚지?" 싶었던 적 있으시면, 원인은 대부분 모델이 아니라 그 앞단 — 데이터와 지식이 준비 안 된 상태에서 시작했기 때문이에요.

🗂️ AI-Ready는 "많이 모으기"가 아니다

문서를 많이 모은다고 AI가 잘 쓸 수 있는 상태가 되는 건 아니에요. 원본이 뭔지, 누가 접근할 수 있는지, 출처가 뭔지, 최신 상태인지까지 같이 갖춰져야 진짜 준비된 거예요.

📎 예시

사내 일반 데이터는 사내 LLM API로 바로 써도 되지만, 고객 데이터는 비식별화·프로젝트 격리가 필요하고, 극비나 국가전략기술급 정보는 외부 LLM 업로드 자체를 막아야 해요. 분류가 안 된 데이터는 일단 다 민감 데이터로 취급하는 게 원칙이에요.

🧭 기준 원본(SSoT)부터 정하자

같은 내용이 여러 문서에 흩어져 있으면 뭐가 최신인지부터 헷갈려요. SSoT(Single Source of Truth)는 모든 걸 한곳에 복사하는 게 아니라, 여러 자료 중에 "이게 기준"이라고 정하고 연결해두는 방식이에요.

💡 Tip

좋은 기준 원본을 고르는 기준은 다섯 가지예요 — 정확한가, 최신 상태를 유지할 수 있는가, 권한과 소유자가 명확한가, 변경 이력을 추적할 수 있는가, 검색·RAG에 재사용할 수 있는가. 이걸 통과 못 하면 기준 원본으로 삼지 않는 게 맞아요.

⚠️ 주의

정보가 여러 군데 흩어진 채로 AI부터 연결하면 근거 없는 답변, 출처 없는 답변, 권한 누락, 민감정보 노출까지 한꺼번에 터질 수 있어요. AI가 빨라질수록 잘못된 기준도 그만큼 빨리 퍼진다는 게 무서운 지점이에요.

🚀 파일럿은 작게, 원칙은 처음부터

첫 시도는 가장 거창한 과제 말고, 반복 질문이 많고 원본이 있고 보안등급이 명확하고 담당자가 있고 효과 측정이 쉬운 영역부터 고르는 게 좋아요. FAQ나 표준 보고서 작성 기준 같은 게 대표적이에요. 작게 시작해도 기준 원본·권한·출처는 처음부터 챙겨야 나중에 안 꼬여요.

✅ AI 도입의 병목은 모델 성능보다 데이터·지식 준비 부족일 때가 많아요
✅ SSoT는 저장소가 아니라 "기준 원본 + 연결 구조"예요
✅ 파일럿은 작게, 기준 원본·권한·출처는 처음부터 챙기세요

출처

반응형