AI가 쓸 수 있는 데이터란 무엇인가 — ODI의 AI-Ready Data 프레임워크
TL;DR
- "AI-ready 데이터"라는 말은 흔하지만, 실제로 뭘 갖춰야 하는지 알려주는 자료는 드물어요
- 영국 ODI(Open Data Institute)가 데이터셋 속성·메타데이터·인프라 3개 축으로 실무 체크리스트를 만들었어요
- 실제 공개 데이터셋 2곳에 적용해봤더니, "완벽한 AI-ready"는 없고 항목별로 강점과 약점이 갈렸어요
이 글은 영국 Open Data Institute(ODI)가 발표한 보고서 "A framework for AI-ready data"(저자 Neil Majithia, Thomas Carey-Wilson, Elena Simperl)를 바탕으로 핵심 내용을 정리·요약한 것입니다. 원문 표현을 그대로 옮기지 않고 구조와 핵심 논지를 재구성했으니, 정확한 인용이 필요하면 원문을 참고하세요.
왜 이 프레임워크가 나왔나
"AI-ready 데이터"라는 말은 요즘 여기저기서 쓰이지만, 정작 "그래서 뭘 어떻게 하면 되는데?"에 답하는 자료는 드물어요. ODI는 이 문제를 정면으로 다뤘어요. AI 실무자와 도메인 전문가를 인터뷰하고 기존 프레임워크들을 검토해서, 데이터를 공개하는 사람(데이터 퍼블리셔)이 실제로 따라 할 수 있는 체크리스트 수준의 기준을 만든 거예요.
핵심 관찰은 이거예요 — 품질 낮은 데이터는 AI 모델에 숨은 문제를 만들고, 편향된 데이터는 성능을 갉아먹으며, 검증되지 않은 평가 데이터셋은 모델 성능을 과대평가하게 만들어요. 그런데도 기존 가이드는 너무 추상적이거나(원칙만 나열), 너무 좁아요(의료 데이터 등 특정 분야에만 적용).
기존 프레임워크들이 놓친 것
보고서는 FAIR 원칙(Findable, Accessible, Interoperable, Reusable)부터 짚어요. FAIR은 데이터 실무의 가장 유명한 기준이지만, AI 실무자들과의 인터뷰에서 나온 공통된 반응은 "원칙은 맞는데 구체적으로 뭘 하라는 건지 모르겠다"는 거였어요. FAIR을 AI용으로 확장하려는 시도(FAIR-R 등)도 있었지만 여전히 개념 수준에 머물러요.
다른 시도들도 각자 한계가 있어요. AIDRIN, Bridge2AI, METRIC 같은 프레임워크는 특정 분야(의료 등)에 갇혀 있거나 데이터 자체의 속성에만 집중하고 주변 인프라는 다루지 않아요. Accenture·Deloitte 같은 기업용 AI 성숙도 프레임워크는 "조직이 AI를 쓸 준비가 됐는가"를 보는 거지 "이 데이터셋 자체가 준비됐는가"를 보진 않고요. DAMA, Gartner 같은 전통 데이터 거버넌스 프레임워크는 메타데이터 관리 등 기본기는 다루지만 AI라는 맥락 자체가 없어요.
AI-Ready 데이터를 이루는 4가지 축
보고서는 AI-ready한 데이터셋을 네 갈래로 정의해요. 기술적 최적화(머신러닝 파이프라인에 바로 넣을 수 있는가), 품질과 표준 준수(일관되고 신뢰할 수 있는가), 법적 준수(라이선스·개인정보 이슈가 정리돼 있는가), 책임 있는 수집(데이터가 어떻게, 누구에 의해 모였는지 투명한가)이에요. 이 네 축을 실제로 점검할 수 있는 형태로 풀어낸 게 아래 프레임워크예요.
시작하기 전 전제조건
본격적인 AI-ready 체크리스트 전에, 데이터가 최소한 갖춰야 할 조건이 있어요. 정제(중복·오류·결측치 정리), 메타데이터 부여(출처·유형·제작자·용도를 알 수 있게), 최대한 개방적으로 공유(법적·프라이버시 제약이 없다면 접근을 넓게)예요. 이 세 가지는 그 자체로 FAIR 원칙을 향한 걸음이자, 아래 AI-ready 기준의 토대가 돼요.
프레임워크 상세
1. 데이터셋 속성 (Dataset Properties)
데이터 그 자체가 갖춰야 할 특성이에요.
| 기준 | 왜 중요한가 |
|---|---|
| 국제 표준·관례 준수 | 국가는 ISO-3 코드, 시간은 ISO-8601처럼 표준을 따라야 다른 시스템과 맞물림 |
| 의미·논리적 일관성 | "심장마비"와 "심정지"처럼 같은 뜻인데 다른 표현이 섞이면 모델이 둘을 다른 개념으로 착각함 |
| 클래스·출처 불균형의 가시화 | 특정 출처 데이터가 과대표집됐다면 최소한 그 사실을 알 수 있어야 함 |
| 필요시 비식별화·익명화 | AI 학습에 쓰일 때는 재식별 위험이 더 커진다는 점을 고려 |
| 적절한 파일 형식 | 엑셀(.xlsx)은 최악, CSV는 무난, Parquet은 컬럼 저장·메타데이터 내장·압축까지 갖춰 최선 |
2. 메타데이터 (Metadata)
데이터를 "설명하는 데이터"가 얼마나 잘 갖춰져 있는가예요.
| 기준 | 왜 중요한가 |
|---|---|
| 기계가 읽을 수 있는 형식 | Croissant 같은 JSON-LD 기반 표준을 쓰면 검색·연동이 쉬워짐 |
| 데이터에 메타데이터가 붙어서 제공 | API로 따로 조회해야 하는 구조는 불편하고 결국 안 쓰이게 됨 |
| 기본 기술 명세 | 데이터 형식, 행·열 규모, 각 열의 의미, 편향 여부, 합성 데이터 여부까지 명시 |
| 수집·가공 이력(공급망 정보) | 누가 어떻게 모으고 가공했는지 — 이상치 대응 시 필수 |
| 라이선스·접근권한·개인정보 관련 고지 | 이름과 링크만이 아니라 "비상업적 이용"이 정확히 뭘 의미하는지까지 |
3. 주변 인프라 (Surrounding Infrastructure)
데이터셋 자체가 아무리 좋아도, 그걸 담고 있는 환경이 부실하면 소용없어요.
| 기준 | 왜 중요한가 |
|---|---|
| 사용자 중심 데이터 포털 | 검색·탐색·품질 검증 도구까지 갖춘 포털이 이상적 |
| API 접근 | RESTful 구조, 페이지네이션 없이 대량 조회 가능해야 실무에서 씀 |
| 버전 관리 인프라 | Git이나 DVC 같은 도구로 변경 이력을 추적할 수 있어야 함 |
실제로 적용해보면 어떨까 — 두 가지 사례
보고서는 이 프레임워크를 실제 공개 데이터셋 두 곳에 적용해봤어요.
사례 1. PDB(Protein Data Bank)의 인간 인슐린 데이터셋
단백질 구조 정보를 담은 PDB는 AlphaFold 같은 노벨상급 AI 모델의 학습 데이터로 쓰인 곳이에요. 국제 표준(mmCIF 형식) 준수, 의미 일관성, 비식별화 이슈 없음 등에서 양호했지만, 파일 형식이 mmCIF 하나뿐이라 AI 파이프라인용 보조 포맷(CSV 등)이 아쉽고 메타데이터도 JSON-LD 같은 AI 친화적 형식은 아니었어요. 종합 판정은 AI-ready — 표준 준수와 접근성은 훌륭하지만 형식 다양성과 메타데이터 정교함은 개선 여지가 있어요.
사례 2. 영국 국립 서지(Linked Open British National Bibliography)
영국 도서관이 공개한 500만 건 이상의 서지 데이터예요. 국제 표준 준수, 개방 라이선스(CC0), 영구 식별자 사용 등에서 강점을 보였지만, Parquet·JSON-LD 같은 AI 친화적 파생 포맷이 없고 편향 고지나 변경 이력 관리가 없으며 SPARQL 엔드포인트도 구버전이라 대량 추출에 제약이 있었어요. 종합 판정은 부분적으로 AI-ready — 표준·라이선스는 훌륭하지만 AI 실무 편의성 면에서는 아직 갈 길이 있어요.
두 사례 모두 "완벽한 AI-ready"는 없고, 항목별로 강점과 약점이 갈린다는 걸 보여줘요.
결론 — 이 프레임워크가 남기는 메시지
보고서가 강조하는 두 가지가 있어요. 첫째, 세 범주(데이터·메타데이터·인프라)는 따로 놀지 않아요 — 하나가 부실하면 나머지도 흔들리니 통합적으로 접근해야 해요. 둘째, 퍼블리셔와 사용자 사이에 경계가 없어야 해요 — 데이터를 만드는 쪽과 쓰는 쪽이 계속 대화해야 데이터·메타데이터·인프라가 실사용에 맞게 개선돼요.
그리고 이 기준들은 AI에만 유용한 게 아니라, 애초에 "좋은 데이터"의 조건이기도 해요. AI-ready를 목표로 데이터를 정비하면, 결국 모든 용도에 더 신뢰할 수 있는 데이터가 된다는 게 이 보고서의 마지막 메시지예요.
✅ AI-ready 데이터는 데이터셋 속성·메타데이터·주변 인프라, 이 세 축이 함께 갖춰져야 해요
✅ 실제 사례 검증 결과 "완벽한 AI-ready"는 없고, 강점과 약점이 항목별로 갈려요
✅ AI-ready를 목표로 데이터를 정비하면 결국 모든 용도에 더 신뢰할 수 있는 데이터가 돼요
