본문 바로가기

전체 글588

반응형
NVLink 퓨전이란 무엇인가: 엔비디아의 미디어텍 투자와 미래 전망 1. NVLink 퓨전이란 무엇인가?1.1 정의NVLink 퓨전(NVLink Fusion)이란?하이퍼스케일러와 AI 네이티브 기업이 자체 개발한 맞춤형 XPU(가속기)와 CPU를 엔비디아의 AI 인프라 플랫폼에 통합할 수 있도록 해주는 연결 기술이자 IP입니다. 엔비디아의 스케일업·스케일아웃 기술 스택과 MGX 랙 스케일 아키텍처를 그대로 활용할 수 있게 해주는 것이 핵심으로, 2026년 컴퓨텍스에서 처음 공개되었습니다.기존에는 GPU 간 초고속 연결 기술인 NVLink가 엔비디아 자체 GPU 사이의 통신에만 쓰였습니다. NVLink 퓨전은 이 범위를 넓혀, 서드파티가 설계한 맞춤형 ASIC이나 CPU도 같은 랙 스케일 아키텍처 안에서 엔비디아 GPU와 함께 동작하도록 만듭니다. 젠슨 황 엔비디아 CEO.. 2026. 9. 1.
SLI, SLO, SLA란 무엇인가: 정의, 관계, 적용 단계 총정리 1. SLI·SLO·SLA란 무엇인가1.1 정의SLI(Service Level Indicator)는 시스템의 실제 동작을 나타내는 정량적 측정값입니다. 요청 성공률, 응답 지연시간, 처리량 같은 실측 수치가 여기에 해당합니다. SLO(Service Level Objective)는 그 SLI에 대해 조직 내부적으로 유지하려는 목표치입니다. 예를 들어 "30일 동안 가용성 99.9% 유지"가 SLO입니다. SLA(Service Level Agreement)는 이 목표를 지키지 못했을 때의 위약금까지 포함해 고객이나 파트너와 외부적으로 맺는 계약입니다.즉 SLI는 지표의 종류, SLO는 그 지표의 목표값, SLA는 그 목표를 외부에 보장하는 약속이라는 위계로 이해하면 됩니다. 이 순서가 흐려지면 "우리 서비스.. 2026. 8. 23.
AI 에이전트 가드레일(Guardrail) 완전 정리: 정의부터 구현 방법, 솔루션 비교까지 1. 가드레일(Guardrail)이란 무엇인가1.1 정의가드레일(Guardrail)은 에이전트의 입력·출력·행동을 안전·보안·정책 기준에 대조해 검증하는 런타임 통제입니다. 정책을 위반하는 콘텐츠나 행동을 차단·수정하고, 규제 대응을 위한 감사 기록을 남깁니다. 학습 단계에서 모델 자체를 정렬(alignment)하는 것과는 다른 개념으로, 가드레일은 모델을 재학습하지 않고 그 바깥에서 결정적으로 통제를 강제하는 계층입니다. 시스템 프롬프트로 "이런 건 하지 마"라고 지시하는 방식은 적대적 공격 앞에서 쉽게 무너지지만, 가드레일은 프롬프트 인젝션이나 컨텍스트 조작 시도와 무관하게 프로그래밍적으로 결과를 검증합니다.1.2 가드레일의 유형유형막는 대상Input (입력)안전하지 않은 프롬프트, 개인정보(PII).. 2026. 8. 17.
골든 데이터셋(Golden Dataset)으로 AI 에이전트 품질을 평가하는 방법 1. 골든 데이터셋(Golden Dataset)이란 무엇인가?1.1 정의골든 데이터셋(Golden Dataset)은 입력(질의, 컨텍스트)과 그에 대한 "정답으로 인정되는 결과"를 쌍으로 묶어 버전 관리하는 데이터셋입니다. 프롬프트 실험, 모델 교체, 배포 전 회귀 테스트, 프로덕션 모니터링 전 과정에서 품질을 측정하는 기준점(source of truth) 역할을 합니다.1.2 좋은 골든 데이터셋의 조건조건의미범위 명확성 (Defined Scope)에이전트 전체 흐름인지, 도구 호출 단계인지, 검색 단계인지 평가 단위를 명확히 한정실사용 대표성 (Production Fidelity)실제 로그·에스컬레이션 사례에서 추출해 실제 트래픽 패턴을 반영다양성 (Diversity)주제, 의도, 난이도, 언어, 적대.. 2026. 8. 17.
RAG 품질 평가 완전 정리: RAGAS 핵심 지표부터 Agentic RAG 트레이스 평가까지 1. 왜 RAG 품질을 별도로 평가해야 하는가?1.1 실패 지점이 두 개다RAG 파이프라인은 검색(Retrieval)과 생성(Generation)이라는 서로 다른 두 단계로 이루어져 있고, 실패도 각 단계에서 독립적으로 발생합니다. 검색이 엉뚱한 문서를 가져오거나, 정답이 담긴 청크를 놓치거나, 순서가 뒤섞일 수 있습니다. 생성은 검색된 컨텍스트를 무시하고 환각을 만들거나, 컨텍스트의 일부만 반영해 답을 잘라 먹을 수 있습니다. 문제는 이 두 실패가 겉으로 보이는 증상이 비슷하다는 점입니다. "답이 틀렸다"는 결과만 보고는 원인이 검색인지 생성인지 알 수 없습니다.1.2 단일 점수로는 원인을 못 잡는다실제로 자주 보고되는 패턴이 있습니다. 오프라인 평가에서 Faithfulness(충실도) 점수가 0.91.. 2026. 8. 9.
LLM 성능 최적화 가이드 - 자체 서빙 모델 vs Public LLM API 호출 1. 왜 두 관점으로 나눠서 봐야 하는가?1.1 개선 방법이 다르다TTFT, TPOT, ITL, E2E Latency, Throughput 지표의 정의는 [LLM 추론 성능 지표 완전 정리] 에서 다뤘습니다(이 글에서는 정의를 다시 설명하지 않습니다). 그런데 같은 지표라도 "누가 무엇을 개선할 수 있는가"는 상황에 따라 완전히 달라집니다.자체 서빙 모델(vLLM, TGI 등으로 모델을 직접 운영): 서버 내부의 배치 스케줄링, 디코딩 전략, 메모리 관리까지 전부 직접 튜닝 가능Public API 호출 (Claude API, Bedrock, Azure OpenAI 등): 서버 내부는 건드릴 수 없고, API가 노출한 옵션(캐싱, 모델 티어, 리전 선택)과 클라이언트 쪽 설정만 조절 가능1.2 개선 방법 .. 2026. 7. 23.
LLM 추론 성능 지표 완전 정리: TTFT, TPOT, ITL, E2E Latency, Throughput 1. LLM 추론 성능 지표란?1.1 지표의 정의LLM 서빙 성능을 이야기할 때 "느리다/빠르다"는 감으로 판단할 수 없습니다. 실제로는 요청이 들어와서 응답이 끝날 때까지의 흐름을 여러 구간으로 쪼개서 측정해야 하며, 이때 등장하는 다섯 가지 지표가 다음과 같습니다.TTFT (Time To First Token)TPOT (Time Per Output Token)ITL (Inter-Token Latency)E2E Latency (End-to-End Latency)Throughput (처리량)이 지표들은 LLM 추론 과정을 "프롬프트를 읽는 단계"와 "토큰을 하나씩 생성하는 단계"로 나눠서 각 구간의 속도와, 시스템 전체가 감당할 수 있는 용량을 각각 측정합니다.1.2 E2E Latency 하나만 볼 때의.. 2026. 7. 23.
반응형