목록으로
10분 읽기

AI 생성 결과의 품질을 검수하고 개선하는 방법

AI 서비스를 개발할 때 초기 데모에서는 결과가 매우 좋아 보일 수 있습니다.

  • #AI 품질 평가
  • #생성형 AI 검수
  • #AI 답변 정확도
  • #프롬프트 테스트
  • #AI 서비스 운영

AI 서비스를 개발할 때 초기 데모에서는 결과가 매우 좋아 보일 수 있습니다.

몇 개의 예시 문장을 입력했을 때 원하는 답변이 나오고, 문서 요약과 이미지 생성도 정상적으로 작동할 수 있습니다.

하지만 실제 사용자에게 공개하면 다양한 문제가 나타날 수 있습니다.

  • 같은 질문에 결과가 계속 달라짐
  • 입력과 관계없는 내용을 생성함
  • 존재하지 않는 정보를 사실처럼 설명함
  • 중요한 항목을 빠뜨림
  • 정해진 형식을 지키지 않음
  • 브랜드 말투와 맞지 않음
  • 일부 사용자에게만 오류가 반복됨
  • 특정 문서나 긴 입력에서 품질이 낮음
  • 모델을 변경한 뒤 기존 기능이 나빠짐

따라서 AI 서비스는 기능이 작동하는지만 검수해서는 부족합니다.

다음 질문에 답할 수 있는 품질 관리 구조가 필요합니다.

어떤 결과를 좋은 결과로 판단하며, 품질이 떨어졌을 때 어떻게 발견하고 개선할 것인가?

먼저 좋은 결과의 기준을 정해야 합니다

AI 결과의 품질은 서비스 목적에 따라 다릅니다.

고객지원 챗봇

  • 정책과 일치하는가?
  • 질문에 직접 답하는가?
  • 근거를 제공하는가?
  • 모르면 추측하지 않는가?
  • 상담원 연결이 적절한가?

콘텐츠 생성

  • 브랜드 말투와 맞는가?
  • 사실 정보가 정확한가?
  • 내용이 반복되지 않는가?
  • 채널 형식에 맞는가?
  • 수정 없이 사용할 수 있는가?

문서 요약

  • 핵심 내용을 포함하는가?
  • 중요한 수치가 정확한가?
  • 원문에 없는 내용을 추가하지 않는가?
  • 결정 사항과 담당자를 구분하는가?

데이터 분류

  • 정답 카테고리를 선택하는가?
  • 애매한 데이터에 적절히 대응하는가?
  • 분류 기준이 일관적인가?
  • 결과 형식이 안정적인가?

하나의 정확도 숫자로 모든 품질을 설명하기 어렵습니다.

품질 평가 항목

1. 정확성

결과의 사실과 수치가 원본 데이터와 일치하는지 확인합니다.

2. 관련성

사용자의 질문과 실제로 관련 있는 답변인지 확인합니다.

3. 완전성

요구한 항목을 빠뜨리지 않았는지 확인합니다.

예시:

text
요청 항목:
요약, 위험요인, 추천 행동

결과:
요약과 위험요인만 생성

4. 형식 준수

정해진 JSON, 표와 목록 형식을 지키는지 확인합니다.

5. 일관성

비슷한 입력에 비슷한 기준을 적용하는지 확인합니다.

6. 문체와 브랜드

  • 존댓말
  • 문장 길이
  • 전문 용어
  • 이모지
  • 금지 표현
  • CTA

7. 안전성과 적절성

서비스 목적에 맞지 않는 결과와 민감한 정보를 생성하지 않는지 확인합니다.

8. 응답 속도

결과가 좋아도 사용자가 너무 오래 기다려야 하면 실제 사용성이 낮아질 수 있습니다.

9. 비용

고품질 모델을 사용해도 요청당 비용이 사업 구조에 맞지 않으면 지속적으로 운영하기 어렵습니다.

평가용 질문 세트

AI 품질을 반복해서 확인하려면 고정된 테스트 데이터를 준비하는 것이 좋습니다.

예시:

text
정상적인 입력
짧은 입력
긴 입력
오타가 있는 입력
정보가 부족한 입력
서로 충돌하는 정보
문서에 답이 없는 질문
금지된 요청
여러 작업을 한 번에 요청

각 질문에 원하는 결과 또는 평가 기준을 연결합니다.

정답이 하나인 작업

분류와 정보 추출처럼 정답을 명확히 만들 수 있습니다.

text
입력:
배송이 아직 오지 않았어요.

정답 카테고리:
배송 문의

정답이 여러 개인 작업

콘텐츠 생성과 요약은 하나의 완벽한 문장만 정답으로 두기 어렵습니다.

평가 기준표를 사용할 수 있습니다.

평가 항목1점3점5점
사실성오류가 많음일부 확인 필요원본과 일치
문체브랜드와 다름일부 수정 필요바로 사용 가능
완전성핵심 누락일부 누락요구 항목 포함
가독성이해 어려움보통명확하고 간결

실제 사용자 질문을 포함해야 합니다

개발자가 만든 예시 질문만으로 테스트하면 실제 사용자 표현을 놓칠 수 있습니다.

  • 오타
  • 줄임말
  • 긴 설명
  • 감정적인 문장
  • 여러 질문
  • 문맥이 부족한 질문
  • 업계 특수 표현

초기 사용자 문의와 실패 사례를 익명화해 평가 세트에 추가할 수 있습니다.

자동 검수

일부 품질은 프로그램으로 확인할 수 있습니다.

1. 필수 항목

text
제목이 있는가?
요약이 있는가?
추천 항목이 세 개 있는가?

2. 글자 수

  • 제목 30자 이내
  • 설명 300자 이내
  • 해시태그 10개 이하

3. 데이터 형식

  • JSON 파싱 가능
  • 날짜 형식
  • 숫자 타입
  • 필수 필드
  • 허용된 카테고리

4. 금지 표현

  • 과장 표현
  • 내부 용어
  • 경쟁사 비방
  • 개인정보
  • 특정 금지 문구

5. 원본값 일치

가격, 날짜와 상품명처럼 확정된 데이터가 결과에서 바뀌지 않았는지 확인할 수 있습니다.

6. 출처 존재

문서 기반 답변에서 실제 근거 문서가 검색되었는지 확인합니다.

자동 검수의 한계

문법과 형식이 맞아도 내용이 틀릴 수 있습니다.

따라서 중요한 결과는 사람의 평가와 함께 사용해야 할 수 있습니다.

사람 검수

1. 운영자 검수

AI가 만든 콘텐츠를 공개하기 전에 담당자가 확인합니다.

적합할 수 있는 분야:

  • 광고
  • 법적·정책 안내
  • 고객 상담
  • 의료·교육 관련 콘텐츠
  • 공식 보도자료
  • 제품 사양

2. 전문가 검수

전문성이 필요한 결과는 해당 분야 전문가가 기준을 만들어야 합니다.

AI 개발자가 내용의 정확성까지 판단할 수 없는 영역이 있기 때문입니다.

3. 사용자 검수

사용자가 AI 결과를 직접 편집하고 최종 승인하도록 할 수 있습니다.

AI를 완성 결과보다 초안 생성 도구로 사용할 수 있습니다.

검수 상태

text
AI 생성
자동 검수 통과
사람 검수 대기
수정 요청
승인
공개

결과를 바로 외부로 보내지 않는 방법

AI 결과가 이메일 발송이나 데이터 변경과 연결된다면 중간 승인 단계를 둘 수 있습니다.

text
AI가 답변 초안 생성
→ 직원 확인
→ 고객에게 발송

초기에는 사람 검수를 유지하고 정확성이 충분히 확인된 일부 작업만 자동화할 수 있습니다.

사용자 피드백

간단한 피드백:

text
도움이 되었나요?
좋아요 / 싫어요

상세 피드백:

  • 사실이 틀림
  • 질문을 이해하지 못함
  • 결과가 너무 김
  • 형식을 지키지 않음
  • 출처가 잘못됨
  • 부적절한 내용

피드백만으로 품질을 판단하기 어려운 이유

사용자는 결과가 정확해도 취향에 맞지 않으면 낮은 평가를 줄 수 있습니다.

반대로 그럴듯하지만 틀린 답변을 높게 평가할 수 있습니다.

사용자 만족도와 사실 정확성을 별도로 측정하는 것이 좋습니다.

재생성 이유

사용자가 다시 생성할 때 이유를 받을 수 있습니다.

text
다른 말투
더 짧게
더 구체적으로
내용이 틀림
결과가 반복됨

재생성률과 이유는 품질 문제를 발견하는 데 도움이 됩니다.

실패 대화 관리

관리자에서 낮은 평가와 오류 결과를 확인할 수 있습니다.

목록 항목:

  • 기능
  • 사용자 입력
  • AI 결과
  • 평가
  • 사용 모델
  • 프롬프트 버전
  • 처리 시간
  • 비용
  • 오류
  • 재생성 여부

개인정보가 포함될 수 있으므로 관리자 열람 권한을 제한해야 합니다.

프롬프트 버전 관리

프롬프트를 수정하면 기존 결과보다 나빠질 수도 있습니다.

저장할 정보:

  • 버전
  • 변경 내용
  • 작성자
  • 적용일
  • 테스트 결과
  • 이전 버전
  • 사용 모델

문제가 발생하면 이전 버전으로 되돌릴 수 있습니다.

모델 버전 관리

AI 모델을 변경하면 다음 결과가 달라질 수 있습니다.

  • 말투
  • 결과 길이
  • 형식
  • 비용
  • 속도
  • 거절 기준
  • 문서 이해

새 모델을 바로 전체 사용자에게 적용하지 않고 일부 테스트에 먼저 적용할 수 있습니다.

A/B 테스트

사용자를 두 그룹으로 나눠 서로 다른 설정을 비교할 수 있습니다.

text
A:
기존 프롬프트

B:
새 프롬프트

비교 지표:

  • 사용자 평가
  • 재생성률
  • 형식 오류
  • 처리 시간
  • 요청당 비용
  • 작업 완료율

사용자 평가만 보지 말고 품질 기준과 비용을 함께 비교해야 합니다.

회귀 테스트

기능을 개선한 뒤 예전에 잘 되던 질문이 나빠질 수 있습니다.

고정된 평가 세트를 새 버전마다 다시 실행해 변화 여부를 확인합니다.

text
기존 버전:
92점

새 버전:
전체 94점
하지만 환불 질문 점수 85점 → 60점

전체 평균만 보면 특정 중요한 영역의 악화를 놓칠 수 있습니다.

분야별 점수

  • 결제 문의
  • 환불
  • 제품 사용법
  • 오류 해결
  • 기업 고객
  • 일반 고객

카테고리별로 품질을 확인하는 것이 좋습니다.

답이 없을 때의 품질

AI가 모든 질문에 답하는 것이 좋은 품질은 아닙니다.

등록된 정보가 없으면 다음처럼 대응하는 것이 더 정확할 수 있습니다.

text
확인 가능한 자료에서 답을 찾지 못했습니다.
담당자에게 문의해 주세요.

답변 거절과 사람 연결의 정확성도 품질 기준에 포함해야 합니다.

근거와 답변의 일치

문서 기반 챗봇은 출처를 표시해도 답변이 근거와 다를 수 있습니다.

확인할 항목:

  • 올바른 문서인가?
  • 해당 문장이 실제 답을 뒷받침하는가?
  • 오래된 문서가 아닌가?
  • 다른 문서와 충돌하지 않는가?
  • AI가 근거보다 과도하게 확장하지 않았는가?

입력 데이터 품질

AI 결과 문제의 원인이 모델이 아니라 입력 데이터일 수 있습니다.

  • 문서가 오래됨
  • 고객 정보가 누락됨
  • 상품명이 잘못됨
  • 문서 버전이 충돌함
  • 스캔 인식 오류
  • 입력 양식이 모호함

AI를 수정하기 전에 원본 데이터를 점검해야 합니다.

결과 후처리

AI 결과를 그대로 사용하지 않고 일반 코드로 정리할 수 있습니다.

  • JSON 검증
  • 날짜 변환
  • 허용 카테고리 확인
  • 잘못된 URL 제거
  • HTML 정리
  • 민감 정보 마스킹
  • 필수 문구 추가

중요한 수치와 업무 규칙은 코드와 데이터베이스에서 다시 검증하는 것이 좋습니다.

다중 단계 생성

한 번에 최종 결과를 생성하기보다 여러 단계로 나눌 수 있습니다.

text
1. 입력 정보 분석
2. 목차 생성
3. 본문 생성
4. 사실 정보 검증
5. 최종 형식 정리

품질이 좋아질 수 있지만 처리 시간과 API 비용이 증가할 수 있습니다.

다른 모델로 재검수

한 AI 결과를 다른 모델이나 별도 평가 과정으로 검수할 수 있습니다.

다만 AI가 AI를 평가한다고 정확성이 보장되는 것은 아닙니다.

자동 평가 결과도 사람 평가와 비교해 신뢰도를 확인해야 합니다.

품질과 비용의 균형

최고 성능 모델과 여러 단계 검수를 사용하면 품질이 올라갈 수 있지만 요청당 비용도 증가합니다.

작업별로 다른 기준을 적용할 수 있습니다.

낮은 위험

  • 제목 추천
  • 아이디어
  • 내부 초안

비교적 가벼운 모델과 간단한 검수

높은 위험

  • 고객 정책 안내
  • 계약 정보
  • 중요한 보고서
  • 외부 공개 콘텐츠

더 강한 검수와 사람 승인

응답 시간

여러 검수 단계를 추가하면 사용자가 오래 기다릴 수 있습니다.

다음 방식을 검토할 수 있습니다.

  • 생성 중 상태
  • 비동기 작업
  • 완료 알림
  • 빠른 초안과 정밀 결과 분리
  • 사용자에게 예상 시간 안내

운영 지표

관리자가 확인할 수 있는 지표:

  • 전체 요청
  • 성공률
  • 실패율
  • 형식 오류율
  • 사용자 평가
  • 재생성률
  • 사람 수정률
  • 평균 처리 시간
  • 평균 API 비용
  • 카테고리별 품질
  • 프롬프트 버전별 결과

사람 수정률

AI 결과에서 얼마나 많은 부분을 사람이 수정했는지 측정할 수 있습니다.

  • 그대로 사용
  • 일부 수정
  • 전체 재작성
  • 폐기

실제 업무 절감 효과를 판단하는 데 유용할 수 있습니다.

AI 품질 관리자 기능

  • 평가 질문 등록
  • 기대 결과
  • 테스트 실행
  • 모델 비교
  • 프롬프트 비교
  • 결과 점수
  • 실패 사례
  • 사용자 피드백
  • 버전 적용
  • 이전 버전 복구

초기 MVP에서는 스프레드시트로 평가를 관리하고, 규모가 커지면 관리자 기능을 추가할 수 있습니다.

품질 개선 순서

text
1. 실패 사례를 수집한다.
2. 문제 유형을 분류한다.
3. 원본 데이터와 문서를 확인한다.
4. 프롬프트·검색·모델 중 원인을 찾는다.
5. 평가 세트에 실패 사례를 추가한다.
6. 변경 버전을 테스트한다.
7. 일부 사용자에게 적용한다.
8. 결과를 확인한 뒤 전체 적용한다.

AI 품질 평가 요구사항 양식

text
AI 기능:
좋은 결과의 기준:
정확해야 하는 정보:
허용 가능한 오류:
평가 항목:
테스트 질문:
정답 데이터:
사람 검수:
자동 검수:
사용자 피드백:
재생성 이유:
출처:
프롬프트 버전:
모델 비교:
응답 시간 목표:
요청당 비용 목표:
관리자 통계:

검수 체크리스트

text
[ ] 정상 입력
[ ] 짧은 입력
[ ] 긴 입력
[ ] 정보 부족
[ ] 문서에 없는 질문
[ ] 충돌 정보
[ ] 필수 결과 항목
[ ] 형식
[ ] 사실 정보
[ ] 금지 표현
[ ] 출처
[ ] 답변 거절
[ ] 사용자 권한
[ ] 프롬프트 변경
[ ] 모델 변경
[ ] 처리 시간
[ ] 비용
[ ] 사용자 피드백

견적서에서 확인할 항목

  • AI 기능 구현만 포함되는가?
  • 품질 기준과 평가 데이터 작성이 포함되는가?
  • 자동 형식 검수가 포함되는가?
  • 사용자 피드백이 포함되는가?
  • 실패 결과를 관리자에서 확인할 수 있는가?
  • 프롬프트와 모델 버전을 기록하는가?
  • 변경 전 회귀 테스트가 포함되는가?
  • 사람 승인 절차가 포함되는가?
  • 품질 개선 작업은 유지보수에 포함되는가?
  • 누가 내용의 정답을 검수하는가?

마무리

AI 생성 결과의 품질은 한 번의 데모나 몇 개의 예시만으로 판단하기 어렵습니다.

안정적인 서비스를 만들려면 다음 구조가 필요합니다.

  • 좋은 결과의 기준
  • 실제 질문을 반영한 평가 세트
  • 자동 형식 검수
  • 사람 검수
  • 사용자 피드백
  • 프롬프트와 모델 버전 관리
  • 변경 후 회귀 테스트
  • 비용과 응답 시간 모니터링

AI가 항상 완벽한 결과를 만들게 하는 것보다, 틀린 결과를 빠르게 발견하고 안전하게 개선할 수 있는 운영 체계를 만드는 것이 중요합니다.

필요한 답을 찾고, 끝까지 완성합니다.

기술을 알지 못해도, 기획서가 없어도 괜찮습니다.

프로젝트 문의하기