← munki notes 건축기술 × AI
AI & 바이브코딩 기업별 AI 플랫폼 해부 시리즈 12 2026-05-30

아이디어 1000개는 AI 데이터셋이 될 수 있다 —
Databricks로 배우는 데이터 자산 설계

파일이 많아지는 것과 데이터 자산이 되는 것은 다르다. ideas.csv + sources.csv + outputs.csv로 분석 가능한 아이디어 자산을 만들고, AI가 다시 쓸 수 있는 원본을 만든다.

Databricks Lakehouse 데이터 자산 아이디어 데이터셋 AI 데이터 설계
Key Insight

당신이 만든 아이디어·PRD·실험 로그는 개인 AI 데이터셋이 될 수 있다.

문서 vs 데이터 자산
문서 (파일 더미)
  • 사람이 직접 읽어야만 접근 가능
  • 필터링·정렬·비교 불가
  • AI가 패턴 찾기 어려움
  • 연결 관계 없음
데이터 자산 (구조화)
  • 필터링·정렬·비교 가능
  • AI가 인덱싱하고 검색 가능
  • 관계 연결로 분석 가능
  • RAG 기반 질문 응답 가능
Databricks Lakehouse 개념
🏞️
Data Lake
원본 데이터 저장. 형식 무관하게 모두 보존
🏛️
Data Warehouse
분석에 최적화된 구조화 데이터. 빠른 쿼리
🔗
Lakehouse
두 가지를 하나의 플랫폼으로 통합. 원본 + 분석을 동시에
🧠
Data Intelligence
데이터 엔지니어링 + 분석 + ML + AI를 같은 기반 위에

개인 데이터 자산 4개 CSV 스키마

아이디어·소스·산출물·관계를 4개 파일로 구조화

ideas.csv — 아이디어 원장
필드설명
id고유 식별자
title아이디어 이름
problem해결하려는 문제
domain도메인 (건축, AI, 교육 등)
portfolio_fit포트폴리오 가치 (high/mid/low)
risk_level위험도 (high/mid/low)
status현재 상태 (수집됨/조사중/구현중/완료/보류)
sources.csv / outputs.csv / relations.csv
파일주요 필드
sources.csvid / title / url / type / reliability / related_ideas
outputs.csvid / type / linked_ideas / linked_sources / status
relations.csvfrom_id / relation_type / to_id

RAG 확장: 아이디어 데이터셋 → AI 검색

ideas.csv가 30개 이상 쌓이면 인덱싱하여 RAG(Retrieval-Augmented Generation)로 확장할 수 있다. "포트폴리오 가치 높은 건강 아이디어 찾아줘"라는 질문에 바로 답할 수 있게 된다.

1
ideas.csv 축적
아이디어를 기록할 때마다 구조화된 행으로 저장
2
벡터 인덱싱
각 행을 임베딩하여 벡터 DB에 저장
3
자연어 검색
"portfolio_fit=high이고 domain=건강인 아이디어" → 즉시 응답

파일이 많아지는 것과 데이터 자산이 되는 것은 다르다. AI에게 일을 맡기려면 먼저 AI가 다시 쓸 수 있는 원본이 필요하다.