업무 문제
외부 모델 API 사용이 제한된 환경에서 여러 형식의 문서를 처리하고, 사용자가 답변을 검토할 수 있는 흐름이 필요했습니다.
CASE STUDY 01 · ON-PREMISE AI
외부 LLM 사용이 제한된 환경에서,
사내 문서를 다루는 AI 서비스를 설계하고 운영했습니다.
모델 서빙부터 문서 처리, 사용자 화면, 배포까지.
세 가지 업무 흐름으로 설계 판단을 살펴보세요.
01 / CONTEXT
외부 모델 API 사용이 제한된 환경에서 여러 형식의 문서를 처리하고, 사용자가 답변을 검토할 수 있는 흐름이 필요했습니다.
온프레미스 모델 서빙, Python 백엔드, 채팅 화면, 문서 처리와 인증·감사·배포 체계를 설계·개발했습니다.
GPU 실행과 요청 대기를 분리했습니다. 전체 수용 요청 25건은 동시 추론 25건을 뜻하지 않으며, 실행 1건과 FIFO 대기열로 관리합니다.
파일 형식 검증과 대화 접근 제어, 원문을 기록하지 않는 감사 로그를 적용했습니다. 운영 문서와 이력은 이 시연에 포함하지 않습니다.
02 / INTERACTIVE WALKTHROUGH
GLM-5.3 Flash 기반 사내 서비스의 화면과 업무 흐름을 보여주는 시연입니다. 응답은 사전 구성된 예시이며 실제 AI 추론·문서 처리는 수행하지 않습니다.
입력·업로드·로그인 없이 동작합니다. 선택 상태는 이 페이지 안에서만 유지되고 초기화 또는 새로고침하면 사라집니다.
03 / EVIDENCE & BOUNDARIES
SGLang 기반 GLM-5.3 Flash 모델 서빙과 웹 채팅을 연계했습니다. 다른 모델로 자동 대체하지 않으며, 배포 실패 시 이전 검증 GLM 릴리스로 복구하는 정책입니다.
2026.09.04 운영 활성화 기록과 2026.09.20 단일 모델 정책을 기준으로 설명합니다. 개발 검증과 운영 반영을 분리하고 단위·통합 검증을 배포 과정에 연결했습니다.
사내 원문 기록은 공개하지 않습니다. 공개 자료만으로 운영 상태를 독립 검증할 수 있다는 뜻은 아닙니다.
시간 절감·정답률·장기 운영 성능은 별도 평가가 필요합니다. 대화·피드백 분석과 현업 비교 실험 후 공개 가능한 집계만 추가할 예정입니다.
예시 결과는 작성된 정적 콘텐츠입니다. 실제 OCR·SSE·인증·대기열은 실행하지 않습니다. 미완성 RAG를 운영 성과로 소개하지 않습니다.