AI Tech Lab · 44 articles

기업 환경에서 실제로 동작하는 AI 시스템 설계를 공유합니다

AI Tech Lab은 기업용 AI Agent, LLM/RAG, 아키텍처, 운영 최적화, 실험 기록을 정리하는 기술 공유 공간입니다. 홍보보다 설계 이유와 트레이드오프를 남기는 방식으로 운영합니다.

Enterprise AI Agent RAG + Tool + Ops
Intent
질문 유형 분류RAG, 생성, Tool 호출 경로를 먼저 나눕니다.
Grounding
Corpus / Chunk / Embedding문서 품질과 검색 전략이 답변 품질을 결정합니다.
Ops
Latency / Cost / Cache운영 단계에서는 속도와 비용이 설계를 바꿉니다.
Latest · 44 Articles

최신 글

각 글은 설계 이유와 운영 트레이드오프를 함께 설명합니다.

생성형 AI 사고 대응 Runbook: 탐지·차단·복구·사후 분석

일반 장애 대응 절차 위에 AI 특유의 모델·프롬프트·검색 인덱스·Tool·데이터 경계를 추가해야 한다. 먼저 사용자와 외부 시스템에 미치는 영향을 차단하고 release ID와 trace를 보존한 뒤, 모델만이 아니라 prompt·policy·Tool·index를 독립적으로 rollback한다. 복구 후에는 재현 사례를 평가셋과 모니터링 규칙으로 전환한다.

글 읽기

RAG 최신성 운영: 생성·수정·삭제·권한 변경과 인덱스 롤백

원본 변경을 create·update·delete·permission change 이벤트로 기록하고 결정적 문서 ID와 버전으로 모든 파생 청크를 멱등 갱신한다. 스키마·파서·임베딩 변경은 새 인덱스를 나란히 구축해 검증 후 alias로 전환하며, 롤백 전에는 삭제·권한 회수 이벤트를 반드시 재적용해 오래된 보안 상태가 되살아나지 않게 한다.

글 읽기

기업용 생성형 AI 데이터 거버넌스와 개인정보 보호 설계

AI 데이터 거버넌스는 데이터 등급과 허용 목적을 사용 사례별로 정하고, 원천 데이터부터 prompt·embedding·모델 공급자·Tool·로그·백업·삭제까지 흐름을 목록화하는 것에서 시작한다. 각 처리 지점에 최소 수집·보존 기한·redaction·지역과 업체 정책을 집행하고, 공급자 약관과 기능별 보존 차이를 증거로 관리하며 사용자가 조회·수정·삭제 결과를 확인할 수 있게 해야 한다.

글 읽기

MCP와 Function Calling은 무엇이 다르고 어떻게 함께 쓰나

Function Calling은 모델이 schema에 맞는 Tool 호출을 제안하는 모델 API 기능이고, MCP는 AI 애플리케이션과 외부 시스템 사이에서 Tool·Resource·Prompt를 발견하고 연결하는 표준 프로토콜이다. MCP Host가 서버의 Tool schema를 읽어 모델의 Function Calling 형식으로 전달하는 식으로 함께 사용된다.

글 읽기

LLM 응답 지연을 사용자 경험과 SLO로 관리하는 법

전체 응답 시간 하나가 아니라 요청 접수, 첫 진행 표시, 첫 유용한 결과, 최종 완료까지를 분리하고 업무 유형별 p95 SLO를 둬야 한다. Streaming은 체감 대기시간을 줄이지만 실제 작업을 빠르게 하지는 않으므로 진행 상태·취소·부분 결과·비동기 완료와 함께 설계해야 한다.

글 읽기

장시간 실행 AI Agent의 재시작·보상·멱등성 설계

장시간 실행 Agent는 채팅 요청 하나가 아니라 영속 상태 머신으로 모델링하고, 각 외부 부작용에 안정적인 멱등성 키를 붙이며 완료된 단계의 결과와 체크포인트를 저장해야 한다. 일시 오류만 제한 재시도하고 취소는 협력적으로 전파하며, 되돌릴 수 없는 단계 전에는 승인하고 부분 완료는 도메인별 보상과 수동 복구 경로로 처리해야 한다.

글 읽기

Prompt, RAG, Fine-tuning 중 무엇을 선택해야 할까

최신 사내 지식을 답하게 하려면 RAG, 출력 형식·역할·제약을 바꾸려면 Prompt와 Structured Output, 반복되는 행동 패턴을 안정적으로 학습시키려면 충분한 평가 데이터와 함께 Fine-tuning을 검토한다. 세 방법은 대체재가 아니라 서로 다른 문제를 해결한다.

글 읽기

Structured Output과 JSON Schema로 AI 시스템 계약을 만드는 법

Structured Output은 필드·타입·필수값 같은 구조를 안정화하지만 추출값의 사실성, 업무 규칙, 권한, 최신성까지 보장하지 않는다. 따라서 공급자 종료 상태를 먼저 처리하고 JSON Schema 검증 뒤 도메인 불변식·근거 대조·권한 검사를 거치며, 스키마 버전과 실패 상태를 명시하고 형식 테스트와 의미 평가를 분리해야 한다.

글 읽기

PDF·표·이미지를 놓치지 않는 멀티모달 RAG 설계

PDF를 단순 텍스트로 평탄화하지 말고 페이지·섹션·표·그림 단위로 분석해 원문 텍스트, 구조화 데이터, 설명 텍스트, 페이지 좌표를 연결 저장한다. 검색 시 질문 유형에 맞는 표현을 함께 찾고, 답변에는 페이지와 원문 영역을 인용해 사용자가 즉시 검증할 수 있게 한다.

글 읽기

기업용 AI Gateway와 Multi-model Routing 참조 구조

AI Gateway는 단순 API 프록시가 아니라 요청의 업무 유형·데이터 등급·필요 기능을 판별하고 허용된 모델 후보 안에서 라우팅하며, 전체 deadline 안에서 제한적으로 재시도·폴백하고 공급자·모델·리전별 서킷 브레이커와 출력 검증을 적용하는 정책 집행점이어야 한다.

글 읽기

기업 RAG 권한 설계: ACL과 메타데이터 필터를 ingestion부터 query까지 연결하는 법

원본 저장소의 ACL을 콘텐츠와 같은 수명주기로 수집해 모든 문서·청크에 상속하고, 인증된 사용자의 principal과 검색 필터를 서버에서 결합한다. ACL 누락·해석 실패·권한 조회 실패 시에는 결과를 비우는 deny-by-default 정책을 적용하고 캐시·로그·인용까지 같은 권한 경계를 지켜야 한다.

글 읽기

Structured Output과 JSON mode는 무엇이 다른가

JSON mode는 문법적으로 유효한 JSON 출력을 목표로 하지만 필요한 필드·타입·enum까지 보장하지 않는다. Structured Output은 지원되는 모델·API에서 strict: true를 사용하고 refusal이 없으며 응답이 중도 종료되지 않았을 때 제공한 JSON Schema 일치를 보장하지만, 값의 사실성·업무 규칙·권한은 서버에서 별도로 검증해야 한다.

글 읽기

AI Agent 관측성: Trace로 검색·모델·Tool 실패를 찾는 법

한 번의 사용자 요청을 분류, 검색, 모델 호출, Tool 실행, 승인, 최종 응답까지 하나의 trace로 연결하고 각 단계의 입력 버전·지연·비용·결과·오류를 기록해야 한다. 다만 원문 prompt와 Tool 결과에는 민감정보가 들어갈 수 있으므로 기본값은 식별자와 요약 중심으로 두고 원문 수집은 별도 승인과 보존 정책 아래에서만 사용한다.

글 읽기

Prompt Injection과 데이터 유출을 막는 기업 AI 신뢰 경계 설계

외부 문서와 도구 결과를 지시가 아닌 비신뢰 데이터로 취급하고, 모델 출력도 실행 명령이 아닌 제안으로 간주해야 한다. 최소 권한·도구 allowlist·읽기와 쓰기 분리·고위험 승인·구조화된 중간 표현·서버 측 권한 및 출력 검증·외부 전송 통제를 겹쳐 적용해야 간접 Prompt Injection의 피해 범위를 줄일 수 있다.

글 읽기

RAG 평가셋과 지표 설계: 검색과 답변을 분리해 측정하는 법

질문별 정답 문서 라벨(qrels)로 retrieval을 평가하고, 고정된 검색 결과를 입력해 answer correctness·groundedness·completeness·citation을 별도로 평가한다. 실제 로그와 도메인 전문가 라벨을 중심으로 answerable·no-answer·권한 없음·충돌 문서 사례를 포함하고, 전체 평균이 아닌 질문 유형별 회귀 기준을 운영한다.

글 읽기
POINTS

AI 시스템 설계 핵심 포인트

기업용 AI 시스템을 실제 업무에 적용할 때 반복해서 확인해야 하는 설계 기준과 운영 관점을 정리합니다.

Point 1

방향성과 기준 세우기

  • 기업용 AI Agent는 왜 챗봇과 달라야 할까
  • 기업 환경에서 AI Agent 아키텍처를 설계하는 방법
Point 2

RAG 핵심 기술 집중

  • RAG 성능은 Chunking과 Embedding에서 갈린다
  • Vector DB 선택보다 중요한 건 검색 전략이다
Point 3

운영 관점 콘텐츠

  • 모든 질문에 RAG를 쓰지 않는 이유
  • LLM 비용과 latency를 동시에 관리하는 법
Point 4

Prompt와 품질 제어

  • Prompt는 UI가 아니라 백엔드 로직이다
  • 기업용 AI는 왜 창의적이면 안 될까
Point 5

AI Agent 레벨 콘텐츠

  • AI Agent는 단순히 답변하지 않는다
  • AI Agent 프레임워크는 어떻게 선택해야 할까
Point 6

운영 안정성과 성숙도

  • Embedding과 검색 결과를 캐싱해야 하는 이유
  • 기업용 AI Agent 구축에서 기술보다 중요한 것

KMWorks AI Tech Lab은 기업 환경에서 실제로 동작하는 AI 시스템 설계를 공유합니다.

AI 프로젝트 문의