← munki notes 건축기술 × AI
AI & 바이브코딩 기업별 AI 플랫폼 해부 시리즈 10 2026-05-30

그럴듯함과 품질은 다르다 —
Langfuse로 배우는 AI 산출물 평가

AI 산출물은 생성물이 아니라 운영 대상이다. 사용자 피드백을 4개 점수축으로 기록하면 불만이 평가 데이터가 되고, 다음 프롬프트의 개선 조건이 된다.

Langfuse tracing 품질 평가 프롬프트 관리 observability
Key Insight

사용자 피드백을 기록하면 불만이 평가 데이터가 되고 개선 조건이 된다.

4개 점수축 — AI 산출물 품질 측정
🎯
decision_quality
선택과 근거가 있는가? 후보만 나열하면 낮음
🔍
detail_density
세부 내용이 충분한가? 추상적 설명만 있으면 낮음
🗺️
scope_coverage
범위가 편향되지 않는가? 특정 측면만 다루면 낮음
📖
readability_fit
독자가 따라올 수 있는가? 전문용어 과다이면 낮음
피드백 → 평가 데이터 → 개선 조건 변환
1
사용자 피드백 수집
"후보만 보인다", "왜 이걸 선택했는지 모르겠다" — 불만을 그대로 기록
2
점수축으로 변환
"후보만 보인다" → decision_quality: 낮음 (최종 선택과 근거 없음)
3
Langfuse에 trace + score 기록
trace_id / 입력 프롬프트 / 출력 / 각 점수축 값 저장
4
다음 프롬프트 개선 조건 생성
decision_quality 낮음 → "다음 요청에 최종 선택과 근거를 반드시 포함" 조건 추가
5
프롬프트 버전 업
v1.0 → v1.1 (개선 조건 명시). 버전별 점수 비교로 개선 효과 측정

Langfuse 4개 핵심 기능

Langfuse는 AI 애플리케이션의 실행 과정을 기록하고, 품질을 측정하고, 개선을 추적하는 오픈소스 observability 플랫폼이다.

기능역할개인 적용
Tracing실행 과정 전체 기록어떤 입력이 어떤 출력을 만들었는지 추적
Prompt Management버전 관리 및 A/B 테스트v1.0 → v1.1 개선 이력 관리
Evaluation품질 점수 기록4개 점수축으로 산출물 평가
Metrics지표 추적 및 시각화점수 추이로 프롬프트 개선 효과 확인

MVP: 산출물 평가 로그

Langfuse 없이 시작하는 평가 데이터 기록

먼저 Langfuse 없이 간단한 로그 테이블로 시작한다. 기록하는 습관이 먼저고, 도구는 나중이다.

필드내용
trace_id실행 식별자 (날짜+작업명)
input사용한 프롬프트 요약
outputAI 산출물 링크 또는 요약
decision_quality1-5점
detail_density1-5점
scope_coverage1-5점
readability_fit1-5점
next_condition다음 프롬프트에 추가할 개선 조건

AI가 만든 산출물은 생성물이 아니라 운영 대상이다. "그럴듯하다"와 "쓸 수 있다"는 다른 판단이고, 그 차이를 점수로 만드는 것이 평가다.