에이전틱스
도메인 7. 개발자 생산성과 운영 지원

7.2워크플로 개선을 지표로 증명하기

예상 학습 시간 40

AI 보조 도구를 도입했다는 사실과 개발 워크플로가 실제로 나아졌다는 사실은 다릅니다. 이 수업에서는 활동량 지표의 함정, 텔레메트리로 관측할 수 있는 항목, 기준선을 갖춘 파일럿 설계, 그리고 측정과 프라이버시의 균형을 다룹니다.

활동량은 성과가 아니다

도입 효과를 보고하라는 요구를 받으면 손에 잡히는 숫자부터 쓰게 됩니다. 세션 수, 생성된 코드 줄 수, 도구 호출 횟수 같은 것입니다. 이런 활동량 지표는 도입 여부를 보여 줄 뿐 개선을 보여 주지 않습니다.

문제는 두 가지입니다. 첫째, 방향이 모호합니다. 코드 줄 수가 늘어난 것은 생산성이 올라간 것일 수도, 불필요한 코드가 늘어난 것일 수도 있습니다. 둘째, 조작하기 쉽습니다. 지표가 평가에 쓰이면 사람들은 그 지표를 올리는 방식으로 행동을 바꿉니다.

성과에 가까운 지표는 결과물이 흘러가는 속도와 품질에서 나옵니다.

층위예시성격
활동량세션 수, 토큰 사용량도입 여부
산출커밋 수, PR 수중간 지표
흐름첫 리뷰까지 걸린 시간, 병합까지 걸린 시간성과에 근접
품질변경 실패율, 되돌림 비율, 결함 유입성과

활동량 지표를 아예 버리라는 뜻은 아닙니다. 비용을 이해하고 도입률을 파악하는 데는 필요하지만, 그것만으로 개선을 주장하면 안 된다는 것입니다. 흐름과 품질 지표를 함께 제시해야 이해관계자를 설득할 수 있고, 이는 6장의 기대치 정렬과 직접 이어집니다.

텔레메트리로 볼 수 있는 것

Claude Code는 OpenTelemetry 기반 텔레메트리를 내보낼 수 있습니다. 조직 차원의 사용량과 비용을 집계하려면 이 경로를 씁니다.

수집되는 지표에는 다음이 포함됩니다.

  • claude_code.session.count — 시작된 세션 수
  • claude_code.lines_of_code.count — 수정된 코드 줄 수
  • claude_code.pull_request.count — 생성된 풀 리퀘스트 수
  • claude_code.commit.count — 생성된 커밋 수
  • claude_code.cost.usage — 세션 비용
  • claude_code.token.usage — 사용 토큰
  • claude_code.code_edit_tool.decision — 코드 편집 도구의 권한 판정
  • claude_code.active_time.total — 총 활동 시간

활성화는 환경 변수로 합니다.

export CLAUDE_CODE_ENABLE_TELEMETRY=1
export OTEL_METRICS_EXPORTER=otlp
export OTEL_EXPORTER_OTLP_PROTOCOL=grpc
export OTEL_EXPORTER_OTLP_ENDPOINT=http://collector.internal:4317

이 목록에서 눈여겨볼 것은 code_edit_tool.decision입니다. 권한 판정 결과가 지표로 나오므로, 앞 수업에서 다룬 정책의 건강성을 관측하는 데 쓸 수 있습니다. 확인 요청이 특정 항목에 몰린다면 그 규칙이 일상 작업을 막고 있다는 신호입니다.

한 가지 한계를 분명히 해 두어야 합니다. 이 지표들은 활동량과 비용 층위에 속합니다. 흐름과 품질 지표는 도구 텔레메트리가 아니라 저장소·이슈 추적·배포 시스템에서 나옵니다. 도입 효과를 주장하려면 두 출처를 결합해야 합니다.

기준선 없는 파일럿은 결론을 못 낸다

도입 효과를 묻는 질문에 답하지 못하는 가장 흔한 이유는 도입 전 수치를 재 두지 않았기 때문입니다. 파일럿 설계에서 정해야 할 것은 다음과 같습니다.

  1. 기준선 기간 — 도입 전 최소 한 주기(스프린트 또는 릴리스 주기) 이상의 지표를 확보합니다.
  2. 비교 대상 — 같은 기간의 다른 팀을 둘지, 같은 팀의 이전 기간과 비교할지 정합니다. 팀 간 비교는 업무 성격 차이 때문에 해석이 어렵고, 시점 간 비교는 계절성과 프로젝트 단계의 영향을 받습니다. 둘 다 한계가 있으므로 어느 쪽을 택했고 어떤 교란 요인이 있는지 명시하는 것이 중요합니다.
  3. 관측 기간 — 학습 곡선을 감안해 충분히 깁니다. 초기 몇 주는 오히려 속도가 떨어지는 것이 정상입니다.
  4. 사전 정의 지표 — 무엇을 볼지 미리 정합니다. 끝난 뒤 좋아 보이는 지표를 골라 보고하면 근거가 되지 못합니다.
파일럿 보고 골격
- 기준선: 도입 전 4주, 병합까지 중앙값 3.2일 / 변경 실패율 8%
- 관측: 도입 후 8주(초기 2주는 학습 구간으로 분리 표기)
- 결과: 병합까지 중앙값 2.4일 / 변경 실패율 9%
- 해석: 흐름은 개선, 품질은 유의미한 변화 없음
- 교란 요인: 관측 기간에 릴리스 동결 1주 포함

마지막 두 줄이 보고서의 신뢰도를 결정합니다. 개선되지 않은 지표와 교란 요인을 함께 적는 보고가, 좋은 숫자만 모은 보고보다 훨씬 설득력이 있습니다.

측정과 프라이버시의 균형

텔레메트리는 진단 능력을 높이지만 노출면도 넓힙니다. Claude Code는 내용 로깅을 별도 설정으로 분리해 두었습니다.

export OTEL_LOG_USER_PROMPTS=1   # 프롬프트 본문 포함
export OTEL_LOG_TOOL_DETAILS=1   # 도구 인자 포함
export OTEL_LOG_TOOL_CONTENT=1   # 도구 입출력 포함

이 설정이 기본으로 꺼져 있는 것 자체가 설계 의도를 보여 줍니다. 본문 수집은 기본값이 아니라 선택이며, 켤 때는 목적과 기간, 접근 주체를 함께 정해야 합니다. 5.4에서 다룬 소재 대장에 이 경로를 반드시 포함시키십시오. 관측성 도구는 개인 데이터가 조용히 쌓이는 대표적 지점입니다.

프라이버시 외에 실무에서 부딪히는 문제가 하나 더 있습니다. 카디널리티입니다. 지표에 사용자 식별자나 세션 식별자 같은 고유값을 속성으로 붙이면 시계열 수가 폭증해 수집 비용이 커지고 대시보드가 느려집니다. 개인별 추적이 정말 필요한지 먼저 묻고, 팀이나 저장소 단위 집계로 충분하다면 그 수준에서 멈추는 편이 낫습니다.

개인 단위 지표에는 또 다른 문제가 있습니다. 개인 평가에 쓰이는 순간 지표가 왜곡됩니다. 사람들은 측정되는 것을 올리는 방향으로 행동하고, 그 결과 지표는 개선을 보여 주지만 실제 성과는 그대로이거나 나빠질 수 있습니다. 도입 효과 측정과 인사 평가를 분리한다는 원칙을 처음부터 명시해 두는 것이 안전합니다.

시험 함정

  • 생성된 코드 줄 수 증가를 생산성 향상의 근거로 제시하는 선택지 — 방향이 모호한 활동량 지표입니다.
  • 도구 텔레메트리만으로 흐름과 품질 지표를 얻을 수 있다는 전제 — 병합 시간이나 변경 실패율은 저장소와 배포 시스템에서 나옵니다.
  • 기준선 없이 도입 후 수치만으로 효과를 주장하는 보고 — 비교 대상이 없으면 결론을 낼 수 없습니다.
  • 파일럿 종료 후 결과가 좋은 지표를 골라 보고하는 방식 — 지표는 사전에 정의되어야 근거가 됩니다.
  • 프롬프트 본문 수집을 기본으로 켜 두는 관측 설정 — 기본은 꺼져 있으며 켤 때는 목적과 기간, 접근 주체를 정해야 합니다.
  • 지표에 개인 식별자를 속성으로 붙여 세밀하게 추적하는 설계 — 카디널리티 폭증과 지표 왜곡을 함께 일으킵니다.

실습 시나리오

실제 시험과 같은 형식의 시나리오 문제입니다.

경영진에게 Claude Code 도입 6개월 성과를 보고해야 합니다. 확보된 자료는 세션 수, 토큰 사용량, 수정된 코드 줄 수이고 모두 꾸준히 증가했습니다. 도입 전 지표는 따로 수집하지 않았습니다. 이 상황에서 가장 적절한 접근은 무엇입니까?

빌드 연습 · 도입 효과 측정 체계 세우기

50
  1. 1.지표 층위 정리

    현재 수집 중인 지표를 활동량·산출·흐름·품질로 분류합니다.

    기대 결과 · 흐름과 품질 층위가 비어 있는지 드러납니다.

  2. 2.텔레메트리 활성화

    테스트 환경에서 OTel 내보내기를 켜고 수집기에서 지표를 확인합니다.

    기대 결과 · 세션·비용·토큰·권한 판정 지표가 수집기에 도달합니다.

  3. 3.기준선 소급 산출

    저장소 기록으로 도입 전 기간의 병합 소요 시간과 변경 실패율을 계산합니다.

    기대 결과 · 도입 전후 비교가 가능한 표가 만들어집니다.

  4. 4.내용 로깅 정책 결정

    프롬프트 본문 수집 여부를 결정하고 켤 경우의 목적·기간·접근 주체를 정합니다.

    기대 결과 · 결정과 근거가 기록되고 소재 대장에 반영됩니다.

  5. 5.보고 골격 작성

    개선된 지표와 개선되지 않은 지표, 교란 요인을 함께 담은 보고 초안을 씁니다.

    기대 결과 · 사전 정의된 지표만 사용했고 교란 요인이 명시되어 있습니다.

출처 및 더 읽기