사내 문서 기반 AI 챗봇을 만들 때 필요한 것
회사의 매뉴얼, 규정과 업무 자료를 직원들이 쉽게 찾을 수 있도록 사내 문서 기반 AI 챗봇을 검토하는 기업이 많습니다.
회사의 매뉴얼, 규정과 업무 자료를 직원들이 쉽게 찾을 수 있도록 사내 문서 기반 AI 챗봇을 검토하는 기업이 많습니다.
직원이 자연어로 질문하면 AI가 관련 문서를 찾아 답변하는 방식입니다.
예시:
직원:
출장비 숙박 한도는 얼마인가요?
AI:
국내 출장 숙박비는 직급과 지역에 따라 다음 기준이 적용됩니다.
근거:
출장비 규정 4장 2조
또는 다음 자료를 검색할 수 있습니다.
- 인사 규정
- 업무 매뉴얼
- 제품 문서
- 영업 자료
- 기술 문서
- 교육 콘텐츠
- 고객 지원 기록
- 회의록
- 사내 공지
하지만 문서를 업로드하고 AI API를 연결한다고 바로 신뢰할 수 있는 사내 챗봇이 완성되는 것은 아닙니다.
다음 문제가 함께 해결되어야 합니다.
- 최신 문서는 무엇인가?
- 서로 충돌하는 문서가 있으면 어떻게 하는가?
- 직원별로 볼 수 있는 자료가 다른가?
- 답변의 근거를 확인할 수 있는가?
- 문서가 바뀌면 챗봇에도 반영되는가?
- AI가 문서에 없는 내용을 추측하지 않는가?
- 개인정보와 기밀자료를 어떻게 보호하는가?
따라서 사내 문서 챗봇의 핵심은 AI 모델 자체보다 문서의 품질과 권한, 검색 정확도와 운영 체계입니다.
문서 기반 AI 챗봇의 기본 흐름
일반적인 흐름은 다음과 같습니다.
문서 등록
→ 문서에서 텍스트 추출
→ 검색할 수 있는 단위로 가공
→ 검색용 데이터 생성
→ 사용자의 질문과 관련된 문서 검색
→ 검색 결과를 AI에 전달
→ 답변과 출처 표시
사용자가 질문할 때 전체 문서를 매번 AI에 전달하는 것이 아니라 관련성이 높은 부분을 먼저 찾아 답변 생성에 활용할 수 있습니다.
이런 구조를 일반적으로 검색과 생성이 결합된 방식으로 설명할 수 있습니다.
먼저 해결할 업무를 정해야 합니다
사내 문서를 검색하는 AI라는 설명은 범위가 넓습니다.
구체적인 사용 목적을 정해야 합니다.
인사·총무
- 휴가
- 출장
- 복지
- 경비
- 보안
- 입사·퇴사 절차
고객 지원
- 제품 사용법
- 장애 해결
- 환불
- 고객 문의 대응
- 상담 답변 초안
영업
- 상품 설명
- 제안서
- 가격정책
- 고객 사례
- 계약 절차
기술 지원
- API 문서
- 개발 가이드
- 장애 대응
- 시스템 구성
- 배포 절차
교육
- 강의 자료
- 매뉴얼
- 퀴즈
- 학습 지원
사용 목적에 따라 필요한 문서와 권한, 답변 형식이 달라집니다.
문서 수집
챗봇이 참고할 자료를 먼저 정리해야 합니다.
- Word
- PowerPoint
- Excel
- 텍스트
- 웹페이지
- Notion
- Google Drive
- 사내 위키
- 데이터베이스
모든 문서를 한 번에 넣기보다 중요도와 품질이 높은 자료부터 시작하는 것이 좋습니다.
문서가 많다고 답변이 좋아지는 것은 아닙니다
오래된 문서와 중복된 자료가 많으면 오히려 잘못된 답변 가능성이 커질 수 있습니다.
예시:
2023년 출장비 규정
2024년 출장비 규정
2025년 개정안
최종_수정_진짜최종.docx
어떤 문서가 현재 기준인지 시스템이 자동으로 정확히 판단하기 어려울 수 있습니다.
문서 등록 전에 다음을 정리하는 것이 좋습니다.
- 최신 버전
- 적용 시작일
- 문서 소유 부서
- 공식·참고 자료
- 폐기 문서
- 중복 문서
- 공개 범위
1. 문서 상태
문서별로 다음 상태를 둘 수 있습니다.
작성 중
검토 중
현재 적용
적용 예정
만료
보관
챗봇은 현재 적용 상태의 문서만 검색하도록 구성할 수 있습니다.
2. 문서 버전
같은 규정이 개정될 수 있습니다.
저장할 정보:
- 문서명
- 버전
- 작성일
- 적용일
- 만료일
- 담당 부서
- 이전 버전
- 변경 내용
사용자가 과거 기준을 물으면 해당 시점의 문서를 찾아야 하는 서비스도 있을 수 있습니다.
3. 문서 카테고리
- 인사
- 재무
- 영업
- 제품
- 기술
- 보안
- 교육
- 고객 지원
카테고리는 검색과 관리자 운영에 활용할 수 있습니다.
4. 문서 메타데이터
문서 본문 외에 다음 정보를 함께 관리할 수 있습니다.
- 제목
- 부서
- 작성자
- 적용 대상
- 언어
- 공개 범위
- 중요도
- 문서 유형
- 키워드
메타데이터가 있으면 사용자 권한과 질문 조건에 맞는 문서를 찾기 쉬워질 수 있습니다.
문서 형식별 고려사항
PDF는 텍스트가 정상적으로 저장된 파일과 이미지로 스캔된 파일이 다릅니다.
확인할 내용:
- 텍스트 추출 가능 여부
- 표
- 다단 편집
- 머리글·바닥글
- 스캔 이미지
- 페이지 번호
- 암호 설정
Word
제목과 문단 구조를 비교적 활용하기 쉬울 수 있습니다.
다만 표, 주석과 변경 이력을 어떻게 처리할지 정해야 합니다.
PowerPoint
슬라이드별 텍스트는 추출할 수 있지만 도형 간 관계와 시각적인 의미는 단순 텍스트만으로 충분히 전달되지 않을 수 있습니다.
Excel
셀과 시트의 구조가 중요합니다.
- 어떤 시트가 기준인가?
- 헤더는 어디인가?
- 수식 결과를 사용할 것인가?
- 표와 설명을 어떻게 연결하는가?
자유로운 엑셀 파일을 일반 문서처럼 처리하면 답변 품질이 낮을 수 있습니다.
이미지와 스캔 자료
이미지 속 글자를 읽는 과정이 추가로 필요할 수 있습니다.
인식 오류와 표, 도장과 손글씨 등은 별도의 검수가 필요합니다.
문서 분할
긴 문서를 검색하기 위해 적절한 단위로 나눌 수 있습니다.
- 제목별
- 장·절별
- 문단별
- 페이지별
- 항목별
너무 짧게 나누면 문맥이 사라지고, 너무 길게 나누면 관련 없는 내용까지 함께 검색될 수 있습니다.
문서 종류에 따라 다른 분할 규칙이 필요할 수 있습니다.
표와 목록
사내 문서에는 표가 많을 수 있습니다.
예시:
| 직급 | 국내 숙박비 | 해외 숙박비 |
|---|---|---|
| 일반 | 10만 원 | 20만 원 |
| 팀장 | 15만 원 | 25만 원 |
표의 행과 열 관계가 깨지면 잘못된 답변이 나올 수 있습니다.
중요한 표는 별도 구조로 저장하거나 답변 테스트를 진행하는 것이 좋습니다.
검색 정확도
사용자의 표현과 문서의 용어가 다를 수 있습니다.
문서 표현
연차유급휴가
직원 질문
남은 휴가 언제까지 써야 해?
비슷한 의미를 찾을 수 있어야 합니다.
다음 요소를 함께 활용할 수 있습니다.
- 의미 기반 검색
- 키워드 검색
- 카테고리
- 부서
- 문서 상태
- 적용일
- 사용자 권한
검색 결과 재정렬
처음 찾은 여러 문서 중 질문과 더 관련 있는 부분을 다시 정렬할 수 있습니다.
다만 검색 단계를 많이 추가하면 응답 시간과 비용이 증가할 수 있습니다.
답변 방식
1. 짧은 답변
출장 신청은 출발 3영업일 전까지 결재를 완료해야 합니다.
2. 근거 포함 답변
출장 신청은 출발 3영업일 전까지 결재를 완료해야 합니다.
근거:
출장관리규정 제5조
3. 단계형 답변
출장 신청 절차
1. 출장 신청서 작성
2. 팀장 승인
3. 경영지원팀 검토
4. 출장 후 정산서 제출
업무 유형별로 원하는 답변 형식을 정할 수 있습니다.
출처 표시
사내 챗봇은 답변을 믿을 수 있는지 확인하는 것이 중요합니다.
출처에 포함할 수 있는 정보:
- 문서명
- 페이지
- 장·절
- 원문 일부
- 적용일
- 원문 열기
사용자가 출처를 눌렀을 때 해당 문서 위치로 이동하게 만들 수 있습니다.
문서에 답이 없을 때
AI가 추측하지 않고 다음처럼 안내하도록 만들 수 있습니다.
등록된 사내 문서에서 해당 내용을 확인하지 못했습니다.
경영지원팀 또는 담당자에게 문의해 주세요.
추가 기능:
- 담당 부서 안내
- 문의 등록
- 상담원 연결
- 답변 요청
- 미답변 질문 수집
충돌하는 문서
서로 다른 문서에서 다른 기준을 제시할 수 있습니다.
예시:
문서 A:
경비 정산은 7일 이내
문서 B:
경비 정산은 14일 이내
대응 방식:
- 최신 적용일 우선
- 공식 문서 우선
- 충돌 사실 안내
- 담당자 확인 요청
- 관리자에게 알림
문서 우선순위를 시스템에 명확히 기록하는 것이 좋습니다.
사용자 권한
사내 문서는 모든 직원에게 공개되지 않을 수 있습니다.
- 전 직원
- 특정 부서
- 팀장 이상
- 임원
- 프로젝트 참여자
- 인사 담당자
- 관리자
챗봇 화면에서 출처 링크만 숨기는 것으로는 부족합니다.
검색 단계부터 사용자가 볼 수 있는 문서만 대상으로 해야 합니다.
부서별 문서
영업팀 질문
→ 영업 문서와 공통 문서 검색
개발팀 질문
→ 기술 문서와 공통 문서 검색
직원의 부서와 역할 정보가 사내 계정 시스템과 연결될 수 있습니다.
기업별 문서
B2B 서비스에서 고객사마다 다른 문서를 제공할 수도 있습니다.
- 기업 A의 계약
- 기업 B의 매뉴얼
- 공통 서비스 문서
다른 기업의 문서가 검색되지 않도록 데이터 분리가 중요합니다.
문서 관리자
운영자가 다음 업무를 할 수 있습니다.
- 문서 등록
- 파일 업로드
- URL 등록
- 카테고리
- 권한
- 적용일
- 버전
- 공개 상태
- 처리 상태
- 재처리
- 삭제
문서 처리 상태
업로드 대기
텍스트 추출 중
검색 데이터 생성 중
사용 가능
실패
처리 실패 원인을 확인하고 다시 실행할 수 있어야 합니다.
문서 수정과 재처리
파일을 변경하면 기존 검색 데이터를 제거하고 새 버전을 반영해야 할 수 있습니다.
정해야 할 내용:
- 기존 버전 즉시 비활성화
- 새 버전 처리 완료 후 교체
- 처리 중 질문 대응
- 검색 캐시
- 버전 롤백
문서 자동 동기화
사내 저장소의 문서를 주기적으로 가져올 수 있습니다.
- Notion
- Google Drive
- 사내 위키
- 데이터베이스
자동 동기화에서 확인할 항목:
- 신규 문서
- 수정 문서
- 삭제 문서
- 권한
- 동기화 주기
- 실패 알림
원본 시스템의 권한 변경도 챗봇에 반영되어야 할 수 있습니다.
사용자 화면
기본 기능:
- 질문 입력
- 답변
- 출처
- 추천 질문
- 새 대화
- 대화 기록
추가 기능:
- 문서 범위 선택
- 부서 선택
- 후속 질문
- 답변 복사
- 피드백
- 원문 열기
- 문의 전환
질문 추천
업무별로 자주 묻는 질문을 제공할 수 있습니다.
휴가
출장
경비
복지
보안
입사 절차
새 직원의 온보딩에도 활용할 수 있습니다.
답변 피드백
직원이 답변을 평가할 수 있습니다.
- 정확함
- 일부 틀림
- 출처가 잘못됨
- 최신 정보가 아님
- 질문을 이해하지 못함
관리자는 부정확한 질문을 확인하고 문서와 검색 설정을 개선할 수 있습니다.
미답변 질문 관리
챗봇이 답하지 못한 질문은 중요한 데이터입니다.
관리자에서 다음을 확인할 수 있습니다.
- 질문
- 사용자 부서
- 발생 횟수
- 현재 답변
- 담당 부서
- 문서 추가 여부
- 처리 상태
반복 질문을 바탕으로 새로운 FAQ와 문서를 만들 수 있습니다.
품질 평가
서비스 공개 전에 실제 질문 목록을 만들어 테스트하는 것이 좋습니다.
평가 항목:
- 정답을 포함하는가?
- 근거 문서가 맞는가?
- 오래된 문서를 사용하지 않는가?
- 권한 없는 정보를 보여주지 않는가?
- 답이 없을 때 추측하지 않는가?
- 질문의 의도를 이해하는가?
- 답변이 지나치게 길지 않은가?
테스트 데이터
부서 담당자에게 실제 질문을 수집할 수 있습니다.
인사팀 질문 100개
영업팀 질문 100개
개발팀 질문 100개
답변 기준과 근거 문서를 함께 준비하면 품질을 비교하기 쉽습니다.
관리자 품질 대시보드
- 전체 질문 수
- 답변 성공률
- 사용자 평가
- 미답변 질문
- 많이 조회된 문서
- 오래된 문서
- 출처 클릭
- 부서별 사용량
수치의 정의를 먼저 정해야 합니다.
개인정보와 기밀정보
사내 문서에 다음 정보가 포함될 수 있습니다.
- 직원 정보
- 고객 정보
- 계약 금액
- 영업 전략
- 기술 문서
- 보안 자료
- 계정 정보
필요한 조치:
- 문서 접근 권한
- 관리자 권한
- 대화 보관
- 로그
- 데이터 삭제
- 외부 모델 전달 범위
- 테스트 데이터 비식별화
- 다운로드 제한
민감한 문서를 처리하는 경우 조직의 보안 정책과 관련 전문가의 검토가 필요할 수 있습니다.
대화 기록 열람
운영자가 직원의 질문 내용을 볼 수 있는지 정해야 합니다.
- 통계만 제공
- 사용자 식별정보 제거
- 신고된 대화만 열람
- 보안 담당자만 열람
- 일정 기간 후 삭제
사내 챗봇 사용자가 감시받는다고 느끼지 않도록 운영 정책을 명확히 안내하는 것이 좋습니다.
API와 서버 구성
문서 챗봇에는 다음 영역이 필요할 수 있습니다.
- 사용자 로그인
- 문서 저장소
- 텍스트 추출
- 검색 데이터
- AI API
- 대화 데이터베이스
- 관리자
- 로그
- 백업
문서 수와 사용자 수, 보안 요구에 따라 서버 구조가 달라집니다.
비용을 결정하는 요소
| 요소 | 범위 영향 |
|---|---|
| 문서 수 | 처리·저장 증가 |
| 문서 형식 | 추출 난도 |
| 스캔 PDF | 문자 인식·검수 |
| 표·이미지 | 구조 처리 |
| 문서 버전 | 최신성 관리 |
| 부서별 권한 | 검색 단계 권한 |
| 기업별 데이터 | 강한 데이터 분리 |
| 자동 동기화 | 외부 저장소 연동 |
| 출처 표시 | 원문 위치 연결 |
| 품질 평가 | 테스트·관리자 |
| 높은 보안 | 로그·암호화·접근 통제 |
| 다국어 | 언어별 문서와 검색 |
MVP로 시작하는 방법
1단계
- 중요 문서 20~50개
- 한 부서 또는 한 업무
- 로그인 직원
- 질문과 답변
- 출처 표시
- 사용자 피드백
- 문서 수동 업로드
2단계
- 부서 확대
- 문서 관리자
- 버전과 적용일
- 미답변 질문
- 권한
- 품질 통계
3단계
- 외부 저장소 자동 동기화
- 여러 기업
- 업무 API 실행
- 다국어
- 고급 보안
처음부터 회사 전체 문서를 넣기보다 정확성을 평가하기 쉬운 업무부터 시작하는 것이 좋습니다.
사내 문서 챗봇 요구사항 양식
챗봇의 목적:
주요 사용자:
대상 부서:
문서 종류:
문서 수:
파일 형식:
스캔 문서:
표와 이미지:
문서 저장 위치:
문서 버전:
적용일:
문서별 권한:
사용자 로그인:
출처 표시:
원문 열기:
대화 저장:
관리자 문서 등록:
자동 동기화:
미답변 질문:
품질 평가:
보안 요구:
예상 사용자 수:
예상 질문 수:
검수 체크리스트
[ ] 최신 문서 답변
[ ] 만료 문서 제외
[ ] 문서에 없는 질문
[ ] 충돌 문서
[ ] 표 내용
[ ] 긴 문서
[ ] 스캔 문서
[ ] 출처 페이지
[ ] 원문 링크
[ ] 부서별 권한
[ ] 다른 기업 문서 차단
[ ] 문서 수정 반영
[ ] 문서 삭제 반영
[ ] 미답변 질문
[ ] 대화 삭제
[ ] 관리자 열람 권한
[ ] 사용자 피드백
[ ] 모바일
견적서에서 확인할 항목
- 문서 업로드만 포함되는가?
- 텍스트 추출과 정제가 포함되는가?
- 문서별 권한이 포함되는가?
- 출처와 원문 위치를 표시하는가?
- 문서 변경 후 자동 재처리되는가?
- 스캔 PDF와 표 처리가 포함되는가?
- 사용자 질문 평가가 포함되는가?
- 문서 저장소 자동 동기화가 포함되는가?
- AI API와 검색 저장소 비용은 별도인가?
- 품질 검수용 질문 작성은 누가 담당하는가?
마무리
사내 문서 기반 AI 챗봇의 품질은 AI 모델의 이름만으로 결정되지 않습니다.
더 중요한 것은 다음과 같습니다.
- 최신이고 정확한 문서를 준비하는가?
- 문서의 적용일과 버전을 관리하는가?
- 사용자 권한에 맞는 자료만 검색하는가?
- 답변과 함께 근거를 보여주는가?
- 답이 없는 질문에 추측하지 않는가?
- 잘못된 답변을 발견하고 개선할 수 있는가?
처음부터 모든 사내 자료를 넣기보다 한 부서의 반복 질문부터 시작해 정확도와 운영 방식을 확인한 뒤 범위를 확장하는 것이 안정적입니다.
