AI 산출물은 생성물이 아니라 운영 대상이다. 사용자 피드백을 4개 점수축으로 기록하면 불만이 평가 데이터가 되고, 다음 프롬프트의 개선 조건이 된다.
사용자 피드백을 기록하면 불만이 평가 데이터가 되고 개선 조건이 된다.
Langfuse는 AI 애플리케이션의 실행 과정을 기록하고, 품질을 측정하고, 개선을 추적하는 오픈소스 observability 플랫폼이다.
| 기능 | 역할 | 개인 적용 |
|---|---|---|
| Tracing | 실행 과정 전체 기록 | 어떤 입력이 어떤 출력을 만들었는지 추적 |
| Prompt Management | 버전 관리 및 A/B 테스트 | v1.0 → v1.1 개선 이력 관리 |
| Evaluation | 품질 점수 기록 | 4개 점수축으로 산출물 평가 |
| Metrics | 지표 추적 및 시각화 | 점수 추이로 프롬프트 개선 효과 확인 |
Langfuse 없이 시작하는 평가 데이터 기록
먼저 Langfuse 없이 간단한 로그 테이블로 시작한다. 기록하는 습관이 먼저고, 도구는 나중이다.
| 필드 | 내용 |
|---|---|
trace_id | 실행 식별자 (날짜+작업명) |
input | 사용한 프롬프트 요약 |
output | AI 산출물 링크 또는 요약 |
decision_quality | 1-5점 |
detail_density | 1-5점 |
scope_coverage | 1-5점 |
readability_fit | 1-5점 |
next_condition | 다음 프롬프트에 추가할 개선 조건 |
AI가 만든 산출물은 생성물이 아니라 운영 대상이다. "그럴듯하다"와 "쓸 수 있다"는 다른 판단이고, 그 차이를 점수로 만드는 것이 평가다.