골든 데이터셋(Golden Dataset)으로 AI 에이전트 품질을 평가하는 방법
1. 골든 데이터셋(Golden Dataset)이란 무엇인가?1.1 정의골든 데이터셋(Golden Dataset)은 입력(질의, 컨텍스트)과 그에 대한 "정답으로 인정되는 결과"를 쌍으로 묶어 버전 관리하는 데이터셋입니다. 프롬프트 실험, 모델 교체, 배포 전 회귀 테스트, 프로덕션 모니터링 전 과정에서 품질을 측정하는 기준점(source of truth) 역할을 합니다.1.2 좋은 골든 데이터셋의 조건조건의미범위 명확성 (Defined Scope)에이전트 전체 흐름인지, 도구 호출 단계인지, 검색 단계인지 평가 단위를 명확히 한정실사용 대표성 (Production Fidelity)실제 로그·에스컬레이션 사례에서 추출해 실제 트래픽 패턴을 반영다양성 (Diversity)주제, 의도, 난이도, 언어, 적대..
2026. 8. 17.
LLM 성능 최적화 가이드 - 자체 서빙 모델 vs Public LLM API 호출
1. 왜 두 관점으로 나눠서 봐야 하는가?1.1 개선 방법이 다르다TTFT, TPOT, ITL, E2E Latency, Throughput 지표의 정의는 [LLM 추론 성능 지표 완전 정리] 에서 다뤘습니다(이 글에서는 정의를 다시 설명하지 않습니다). 그런데 같은 지표라도 "누가 무엇을 개선할 수 있는가"는 상황에 따라 완전히 달라집니다.자체 서빙 모델(vLLM, TGI 등으로 모델을 직접 운영): 서버 내부의 배치 스케줄링, 디코딩 전략, 메모리 관리까지 전부 직접 튜닝 가능Public API 호출 (Claude API, Bedrock, Azure OpenAI 등): 서버 내부는 건드릴 수 없고, API가 노출한 옵션(캐싱, 모델 티어, 리전 선택)과 클라이언트 쪽 설정만 조절 가능1.2 개선 방법 ..
2026. 7. 23.