← imai 홈
measure-first · 신뢰도 보정(calibration)

우리 신뢰도 점수는 보정돼 있다

오탐게이트의 운영점 다이얼(p_reject)이 실제 오탐 확률과 일치하는지 GT로 검증·보정했다. "신뢰도 0.7"이 실제로 70% 오탐을 뜻하도록 — 부풀린 수치가 아니라 계약 가능한 의미 있는 확률로.

결과

Platt 보정으로 오차(ECE) 44% 감소

0.114
보정 전 ECE (미보정 다이얼)
0.063
보정 후 ECE (Platt)

표본: 교량 GT 시험셋 649개 인스턴스(167 오탐 / 482 진짜균열), fit/test 분리. ECE(Expected Calibration Error)는 "신뢰도"와 "실제 오탐율"의 평균 괴리 — 낮을수록 다이얼 눈금이 진짜 확률.

reliability diagram

회색=신뢰도(이상), 초록=실제 오탐율 — 둘이 같을수록 보정됨

보정 전 (raw)

0.0–0.1
이상 0.05
실제 0.05
n=64
0.1–0.2
이상 0.14
실제 0.02
n=46
0.2–0.3
이상 0.25
실제 0.11
n=56
0.3–0.4
이상 0.36
실제 0.17
n=24
0.4–0.5
이상 0.44
실제 0.31
n=26
0.5–0.6
이상 0.55
실제 0.47
n=57
0.6–0.7
이상 0.64
실제 0.44
n=27
0.7–0.8
이상 0.75
실제 0.62
n=21
0.8–0.9
이상 0.84
실제 0.00
n=3

보정 후 (Platt)

0.0–0.1
이상 0.07
실제 0.04
n=45
0.1–0.2
이상 0.15
실제 0.03
n=78
0.2–0.3
이상 0.24
실제 0.13
n=55
0.3–0.4
이상 0.36
실제 0.34
n=64
0.4–0.5
이상 0.45
실제 0.47
n=53
0.5–0.6
이상 0.54
실제 0.56
n=23
0.6–0.7
이상 0.63
실제 0.50
n=6
왜 중요한가: 미보정 점수는 모델마다 분포가 달라 그대로는 계약 근거가 못 된다(산업 검사 AI 연구가 지적). 우리는 GT로 보정해 다이얼 눈금이 실제 오탐 확률을 뜻하게 만들었다 — 이게 "오탐 −X% @ recall Y%"를 고객별로 신뢰가능하게 계약하는 전제이자, 능동학습 데이터 루프(불확실 항목 선별)의 기반이다.
immersivecast · measure-first · 게이트 신뢰도 보정(calibration.json)