도메인 4 · 시험 비중 16%
평가와 테스트, 최적화
Evaluation, Testing & Optimization
정확도·지연시간·비용·안전성·보안을 지표로 정의하고 측정합니다. 혼합 방법론을 쓰는 평가 데이터셋과 테스트 프레임워크 설계, A/B 테스트와 반복 개선, 프롬프트 실패와 환각·모델 불일치의 진단, 토큰·지연시간·비용 성능 최적화, 로깅과 관측성 도구를 통한 성능 모니터링을 다룹니다.
정확도, 지연시간, 비용, 안전성, 보안은 서로 맞물려 움직이는 다섯 축입니다. 이 수업에서는 각 축을 태스크에 맞게 조작적으로 정의하는 방법과, 기준값을 남의 숫자가 아니라 자기 시스템의 기준선에서 끌어내는 절차를 다룹니다.
평가 데이터셋은 시스템이 실제로 만나는 입력 분포를 대표해야 하고, 채점은 한 가지 방법에만 의존하지 않아야 합니다. 이 수업에서는 데이터셋 구성 원리와 코드 채점, 심판 모델, 사람 평가를 섞어 쓰는 설계, 그리고 이를 반복 실행 가능한 프레임워크로 만드는 방법을 다룹니다.
오프라인 평가는 후보를 걸러 내고, 온라인 실험은 실제 사용자에게서 답을 얻습니다. 이 수업에서는 두 단계의 역할 분담, 실험 설계에서 정해야 할 것들, 그리고 결과 해석에서 반복되는 통계적 함정을 다룹니다.
같은 증상이라도 원인은 프롬프트, 검색, 모델, 도구 중 어디든 될 수 있습니다. 이 수업에서는 증상에서 원인 후보를 좁히는 절차와 환각의 유형별 대응, 그리고 최소 재현 사례를 만들어 원인을 확정하는 방법을 다룹니다.
최적화는 아무 데나 손대는 것이 아니라 비용과 지연의 구성 요소를 분해한 다음 큰 몫부터 줄이는 일입니다. 이 수업에서는 구성 요소 분해, 프롬프트 캐싱이 듣는 조건과 듣지 않는 조건, 그리고 최적화 순서와 회귀 방지를 다룹니다.
LLM 시스템은 같은 입력에도 다른 출력이 나올 수 있고 실패가 예외가 아니라 낮은 품질의 형태로 나타납니다. 이 수업에서는 무엇을 남길지, 다단계 파이프라인을 어떻게 잇는지, 그리고 경보를 어떤 지표에 걸어야 하는지를 다룹니다.