evaluation · PoC

AI PoC는 무엇을 기준으로 성공과 실패를 판단해야 하나

AI PoC의 성공 기준은 ‘답변이 자연스럽다’가 아니다. 실제 사용자가 업무를 끝낼 수 있는지, 틀리거나 근거가 없을 때 안전하게 멈추는지, 운영 환경의 권한·속도·비용을 감당할 수 있는지를 함께 확인해야 한다.

30초 답변

AI PoC는 대표 업무와 실패 사례를 포함한 고정 질문셋으로 검수한다. 검색 정확도, 답변 근거, 업무 완료, 권한 위반, 안전한 실패, 응답 시간과 업무당 비용을 따로 측정하고, 운영 전 반드시 통과해야 할 항목은 평균 점수로 상쇄하지 않는다.

성공의 단위를 업무로 잡는다

“답이 자연스럽다”는 인상은 시작점일 뿐이다. 상담 초안을 만들었다면 담당자가 실제로 사용할 수 있는지, 문서를 찾았다면 근거 구절이 맞는지, Tool을 호출했다면 올바른 대상과 인자를 선택했는지를 봐야 한다.

  • 사내 규정 질문에 근거를 붙여 답한다.
  • 견적서에서 필요한 필드를 빠짐없이 추출한다.
  • 설비 이상 원인을 찾고 담당자에게 필요한 다음 조치를 제시한다.
  • 자료가 없으면 추측하지 않고 확인 경로를 안내한다.

평가셋은 쉬운 질문만 모으지 않는다

운영에서 만날 질문을 유형별로 나눈다.

질문 유형확인할 것
정상 질문필요한 답과 근거를 제공하는가
표현이 다른 질문약어·오타·현장 표현을 이해하는가
답이 없는 질문만들어내지 않고 한계를 알리는가
문서가 충돌하는 질문최신성과 우선순위를 확인하는가
권한 밖 질문검색 결과와 답변을 차단하는가
고위험 실행사람 승인 전에는 실제 변경하지 않는가

지표를 한 숫자로 합치지 않는다

검색, 생성, Tool 실행은 실패 원인이 다르다. 검색이 틀렸는데 모델 점수만 조정하거나, 정답 문서를 찾았는데 인용이 잘못된 문제를 같은 오류로 취급하면 개선 방향을 찾기 어렵다.

  • Retrieval: 정답 문서가 후보에 포함됐는가
  • Grounded answer: 답변이 제공된 근거 안에서 작성됐는가
  • Completeness: 업무에 필요한 핵심 항목을 포함했는가
  • Tool correctness: 올바른 도구와 인자를 선택했는가
  • Safety: 권한·개인정보·승인 경계를 지켰는가
  • Operation: 지연, 실패율, 재시도와 비용이 허용 범위인가

필수 통과와 개선 대상을 나눈다

모든 지표에 같은 가중치를 주지 않는다. 권한 밖 문서 노출, 승인 없는 외부 발송, 개인정보 유출처럼 영향이 큰 항목은 한 건이라도 발견되면 원인을 고치고 다시 검수하는 게 맞다. 반면 문장 표현이나 응답 속도는 목표 범위와 개선 우선순위를 둘 수 있다.

사람 평가와 자동 평가를 함께 쓴다

자동 평가는 반복 비교에 유용하지만 실제 업무 적합성을 전부 대신하지 못한다. 업무 담당자는 답이 맞는지만 아니라 빠진 조건, 책임 있는 표현, 실제 다음 행동을 확인한다. 개발자는 같은 평가셋을 모델·프롬프트·검색 인덱스 변경 때마다 다시 실행한다.

OpenAI 평가 가이드도 평가 목표와 데이터셋, 지표를 정의하고 지속적으로 평가하는 흐름을 권한다. NIST AI RMF Measure는 배포 상황과 비슷한 조건에서 시험하고, 지표·방법·결과를 문서화하며 운영 중에도 모니터링할 것을 제시한다.

PoC 종료 보고서에 남길 것

  • 대상 사용자와 완료할 업무가 명확하다.
  • 평가 질문과 기대 결과가 버전으로 관리된다.
  • 검색·답변·Tool·안전을 분리 평가했다.
  • 필수 통과 항목과 개선 항목을 구분했다.
  • 실패 사례와 사람 이관 흐름을 확인했다.
  • 응답 시간과 완료 업무당 비용 범위를 기록했다.
  • 운영 전 추가 개발 항목과 책임 범위를 남겼다.

KMWORKS Reference Demo로 확인하기

데모를 볼 때 최종 답만 보지 말고 근거, 처리 단계, 사람 승인과 실패 안내를 함께 확인한다.

KMWORKS 자체 제작 Reference Demo이며 샘플 데이터를 사용한다. 고객 납품 실적이나 실제 고객 데이터 기반 성능을 의미하지 않는다.

Reference Demo 01제조 품질 클레임 AI Agent

클레임과 품질 자료를 찾아 원인 후보와 검토 근거를 제시한다.

데모 실행 ↗
관련 가이드AI PoC 발주 검수 기준

계약 전에 합의할 질문셋, 권한, 인수 범위를 발주 관점에서 정리했다.

가이드 보기

근거 자료

자주 묻는 질문

평균 정답률이 높으면 PoC에 성공한 것인가?

아니다. 자주 묻는 쉬운 질문이 평균을 올릴 수 있다. 고위험 질문, 근거가 없는 질문, 권한이 다른 질문을 분리해 보고 실제 업무 완료 기준으로 판단해야 한다.

평가 질문은 누가 만들어야 하나?

개발팀만 만들지 말고 실제 사용자와 업무 담당자가 함께 만들어야 한다. 운영 로그, 기존 문의, 실패 사례와 예외 업무를 포함해야 한다.

PoC에서 운영 비용까지 알 수 있나?

정확한 장기 비용을 확정하기는 어렵지만 업무당 모델 호출, 검색, Tool, 재시도와 사람 검토를 기록하면 운영 예산의 범위를 추정할 수 있다.