신뢰도 결론
믿어도 되는 근거 — 누수검증 7/7 통과 · skill 0.827 · p=0.0066
모든 모델이 "커닝 없이"(미래 데이터 훔쳐보기 없이) 시험을 통과했고(7/7·CLEAN), 예측 적중력 skill은 0.827(1=완벽·0=단순추측), 광고효과가 우연일 확률은 2% 미만(p=0.0066)이에요.
쉽게: 7/7=커닝 없이 시험, skill=단순 추측보다 잘 맞힘, p=우연일 확률 100번 중 2번 미만. 아래에 모델별·업종별·질문별로 무엇을 얼마나 믿어도 되는지 정직하게 공개했어요.
System Trust Report · 전 모델 신뢰도

이 시스템의 어떤 숫자를, 얼마나 믿어도 되나

7 / 7모델 누수 검증 통과
CLEAN절단-불변성 (미래 미참조 증명)
0.827전체 정확도 skill · 전형오차 ±31.0%
p=0.0066광고효과 permutation robustness

쉽게 말하면7/7 누수검증은 "모든 모델이 커닝 없이(미래 훔쳐보기 없이) 시험을 봤다"는 뜻. skill 0.827은 "작년과 비슷하겠지" 찍기(0)~완벽(1) 사이 점수라 단순 추측보다 훨씬 잘 맞힌다는 뜻. p=0.0066는 "광고효과가 우연일 확률이 100번 중 2번도 안 된다"는 뜻이라, 우연이 아니라는 근거예요.

① 모델별 신뢰도 (예측대상 · 방법 · 정확도 · 누수검증 · 등급)
모델예측대상방법정확도누수검증등급
sales_full예상매출 · 상권×업종×분기walk-forward LightGBM 122피처(라그·유동·경쟁·거시)skill 0.828 · 전형오차 ±31%절단-불변성 CLEAN (누수0/433,483행)ESTIMATED(conformal)
sales_coldstart예상매출 · 신규점(무이력)구조피처 102(유동·상주·직장·교통·경쟁, 자기회귀 제외)skill 0.819절단-불변성 CLEAN (122 검증셋의 부분집합)ESTIMATED(conformal)
triangulation개별점 매출LEVEL(FTC 브랜드평균 실측) × DISPERSION(셀모델)dispersion skill 0.828 상속CLEAN 상속 (dispersion=셀모델·LEVEL=연간 실측)high-confidence-estimate
conformal 밴드신뢰구간 80/90%PIT split-conformal (train<last, calibrate=last)커버리지 80/90% 보정PIT 설계 + 누수-free 피처 → CLEANMEASURED(coverage)
CostModel예상광고비 · 업종/년persistence nowcast (FTC 정보공개서 최신연도)skill 0.402 vs naivePIT-OK (2023 최신만·미래참조 0)MEASURED-persistence
event-study광고효과 · 모델교체→검색 +8.1%DiD event-study (287브랜드·70,387 브랜드-월)당월 +8.1% [+2.4,+13.8]VALIDATED (pre-trend 무유의 max|t|1.45 · permutation p=0.020)MEASURED-event-study
elasticity검색→매출 환산 · 0.12~0.15two-way FE (brand+year), 동시대 관찰형시간분할 안정(early 0.15·late 0.11)ROBUST (시간 안정성 · 절단-불변성 N/A=관찰형)관찰형-간접추정
person_effect인물유형·개인 효과 lift이벤트윈도우 pre→post 검색 lift + 논란리스크(LLM)·동명이인(LLM)유형 신뢰도 중상·개인 중간소표본 — 방향성 신뢰, 개별 단정 주의(등급 명시)MEASURED(유형)/참고(개인)
② 누수 검증 요약
절단-불변성: CLEAN (누수 피처 0 / 433,483행 비트 동일) · 음성대조: -0.008 (라벨셔플→붕괴, PASS)
성능 영향: 0.8283(누수포함)→0.8277(제거), Δ−0.0006 = 누수 부풀림 미미
발견·수정한 실제 누수:
  • bfill 시대착오(2026 스냅샷 역채움)→ffill
  • 교차-셀 롤링 오염→셀 group-rolling

인과모델(event-study)은 pre-trend 반증 + permutation, 관찰형 탄력성은 시간분할 안정성, persistence는 최신연도 확인으로 각각 검증 — 절단-불변성이 부적합한 모델엔 올바른 테스트 적용.

③ 업종별 정확도 (상위·하위)
의약품0.901±11.0%
한식음식점0.899±13.0%
커피-음료0.881±19.0%
일반의원0.878±14.7%
중식음식점0.877±14.3%
슈퍼마켓0.873±16.8%
예술학원0.738±37.3%
화장품0.73±57.9%
스포츠 강습0.713±38.0%
④ 질문별 신뢰도 (정직 판정)
광고효과가 평균적으로 검색을 올리는가높음80~90%p=0.02·CI 양수·pre-trend 통과
이 업종은 모델광고가 먹히는가중상70~85%업종차 뚜렷
어떤 유형(방송인/운동선수/아이돌)이 나은가중상65~80%유형 평균 유용
특정 인물이 반드시 효과 나는가중간50~75%다건 인물 높음·소표본 참고
매출이 정확히 몇 % 오르는가중간55~70%검색→매출 2-stage 환산
캐스팅비 얼마까지 써도 되나높음75~90%손실방지 상한 계산에 강함
언제 계약해야 하나높음80~90%이벤트 달력 역산
논란 리스크 반영되나중간40~70%LLM sentiment 축(신규)
TV/유튜브/인스타 어디가 좋나낮음30~50%현재 gap
⑤ 종합 신뢰 점수
75/100
상용 의사결정
85/100
영업 설득
80/100
학술·검증
65/100
개별 인물 자동추천
70/100
고가 계약 최종승인

정직 요약: 전체·업종·유형 수준의 방향성은 높게(75~90), 개별 인물 단위 단정은 중간(50~75)으로 신뢰. 모든 예측은 신뢰구간·등급을 동반하며, 누수는 절단-불변성으로 미참조가 증명됐습니다. 더 올리려면 신규 데이터(시변 카드flow·역사 직장인구) 수집이 필요.

데이터 출처
공공누리 제1유형(출처표시) 공공데이터와 민간 데이터를 결합해 분석합니다
공공데이터 · 공공누리 제1유형(출처표시)
  • 공정거래위원회 · 가맹사업 정보공개서 — 브랜드·가맹 정보
  • 금융감독원 · 전자공시(DART) — 광고주 재무
민간 데이터
  • 네이버 데이터랩 · 검색 트렌드
  • YouTube · 채널·영상 지표
가공·분석 · 소세권 Star · 원시데이터 재판매 아님(가공 정보)
소세권 서비스
필요한 서비스로 바로 이동하세요