본문 바로가기
PM 인사이트

AI 자동 평가가 놓친 실수, 결국 사람 눈이 잡아냈다

by 스킬사공사 2026. 9. 27.

TL;DR

- AI 제품의 오류를 찾아내는 '평가(evals)' 작업이 PM 채용 공고에도 등장하기 시작했어요.
- 자동 채점 에이전트는 뻔한 오류는 잘 잡지만, 판단이 필요한 실수는 놓치고 오히려 정상 응답까지 실패로 잘못 표시했어요.
- 사람이 대화 기록 100건을 직접 훑어보고 실패 유형을 묶어내는 3단계 절차가 여전히 가장 확실한 방법으로 꼽혔어요.

📌 무슨 일이야

실리콘밸리 프로덕트 매니저들이 즐겨 읽는 뉴스레터 레니스 뉴스레터(Lenny's Newsletter)에 9월 22일 올라온 글에서, AI 평가 전문가 하멜 후사인과 슈레야 샹카르가 AI 제품에 숨은 실패를 찾는 법을 다뤘어요. 두 사람은 아파트 임대 상담 챗봇의 실제 대화 기록 100건을 놓고 자동 채점 에이전트와 사람이 각각 오류를 찾게 한 뒤 결과를 비교했어요. 에이전트는 응답과 도구 결과가 서로 어긋나는 것 같은 뻔한 오류는 잘 잡아냈지만, 응대 방식이나 예의처럼 판단이 필요한 문제는 놓쳤고, 심지어 잘 처리된 응답까지 실패로 잘못 표시하는 노이즈를 만들어냈어요.

📌 왜 중요해

이 결과가 PM에게 중요한 이유는 채용 시장이 이미 움직이고 있어서예요. 글쓴이들이 살펴본 PM 채용공고 25건 중 절반 가까이가 평가 관련 경험을 요구 조건에 넣고 있었대요. 실제로 이 방식을 적용한 기업들의 성과도 구체적이에요. 기업용 지출관리 스타트업 램프(Ramp, 회사 카드와 경비 처리를 자동화하는 서비스)는 영수증 매칭 정확도를 35%에서 83%로 끌어올렸고, 법률 AI 스타트업 하비(Harvey)는 내부 품질 점수를 거의 두 배로 올렸어요. AI 코딩 도구 커서(Cursor)도 이 방식으로 비용을 41% 줄이면서 만족도까지 높였다고 해요.

📌 다음은?

글쓴이들이 제안하는 절차는 딱 세 단계예요. 사용자와 나눈 대화 전체 기록을 모으고, 사람이 최소 100건을 훑어보며 실패만 골라 표시하고, 비슷한 실패를 묶어 우선순위를 매기는 거예요. 익숙해지면 30분이면 끝나는 루틴이라고 밝혔어요. 랭스미스(LangSmith)나 아라이즈(Arize) 같은 평가 플랫폼과 무료 실습 자료도 함께 공개됐으니, AI 제품을 맡은 PM이라면 다음 스프린트에 한 번쯤 이 절차부터 돌려보는 것도 방법이에요.

출처

반응형