← imai 홈
measure-first · 데이터 해자(active learning)

우리 데이터 해자는 실제로 복리가 된다 — 측정했다

경쟁조사가 지목한 유일한 복제불가 자산: 점검자의 유지/제외 리뷰 → 재학습 → 시설별 개선. 이 리포트는 그 루프의 메커니즘이 작동함을 시연한다.

⚠ 정직성 정정(2026-07-11): 아래 실험의 "점검자 교정 라벨"은 실제 점검자 라벨이 아니라 GT 마스크로 만든 시뮬레이션이다(유료 파일럿 전이라 실 /feedback 라벨 0개). 또한 전략 간 격차가 J 0.02~0.04로 노이즈 수준·단일 시드(CI 없음)다. 따라서 이건 "완승"이 아니라 루프가 배선되어 있고 교정신호가 선별가치를 가질 수 있다는 메커니즘 시연이다. 실 성능 우위 주장은 실 점검자 라벨 + 부트스트랩 CI로 재측정해야 성립한다(후속 과제).

결과 — 선별 전략별 게이트 분리력 (Youden J)

교정(disagreement) 선별이 근소 우위 — 시뮬 라벨·단일시드·격차 노이즈 수준(아래 정정 참조)

disagreement@500
게이트판정≠라벨=점검자 교정
J 0.280
rec 81.6% · FP−46%
random@500
수동 baseline
J 0.257
rec 64.2% · FP−62%
v3@1800 (참조)
무선별 4배 데이터
J 0.243
rec 77.8% · FP−46%
uncertain@500
경계 불확실성 샘플링
J 0.239
rec 79.7% · FP−44%
base (무FT)
게이트 재학습 전
J 0.203
rec 70.3% · FP−50%

J = 민감도(recall보존) + 특이도(FP감소) − 1. 게이트를 이진분류기로 볼 때 임계점 분리력. 모든 전략 동일 예산 N=500·동일 하이퍼(max_steps 120)·동일 검출인스턴스 350개로 평가 → 공정. held-out = 교량 시험셋 100장(학습 미노출, 검출 TP212/FP138).

동일 예산, 선별 전략만 변수

전략 (N)recall보존FP감소Youden Jbal_acc
disagreement@50081.6%46.4%0.2800.640
random@50064.2%61.6%0.2570.629
v3@1800 (참조)77.8%46.4%0.2430.621
uncertain@50079.7%44.2%0.2390.620
base (무FT)70.3%50.0%0.2030.601

발견

이 실험이 말하는 것 (정직)

over-claim 안 함: 순수 불확실성 샘플링(uncertain)은 random을 하드판정 J로 이기지 못했다(0.239 vs 0.257). 작동하는 exploration 신호는 "경계 불확실성"이 아니라 "교정(disagreement)"이라는 것이 이 실험의 비자명한 결론. (uncertain·random은 운영점이 크게 달라 단일점 비교에 혼입 — 매칭-FP 다이얼 정합은 소형크롭 44/350 게이트불가로 부분 제한, 후속 과제.)

메커니즘 — 제품에 이미 배선됨

점검자 UX가 곧 최고가치 라벨 생성기

① 캡처

리뷰 → 라벨

점검 시 결함 크롭·게이트판정·보정 p_reject 저장. /feedback이 점검자 유지/제외를 라벨로 확정하고 agreement(게이트 vs 점검자)를 계산.

② 선별

교정 우선

al_selectagreement=False(교정) 크롭을 우선 선별 — 실측상 최고가치. 시설·class 균형.

③ 재학습

시설별 어댑터

선별셋 → Cosmos LoRA(운영 프롬프트 동일) → HF PEFT 어댑터 hot-swap.

④ 측정

held-out 증명

학습 미노출 시험셋 다이얼로 개선을 항상 검증. 회귀 시 미채택.

경쟁사가 복제 못하는 이유는 알고리즘이 아니라 원천이다 — 현장 접근 + 점검자 노동으로만 나오는 교정 라벨. 우리 제품의 리뷰 UI가 그 원천을 자동 수집한다. 루프의 복리는 첫 유료 파일럿(실데이터 유입)부터 실현된다.

재현

pool_score.py(base 게이트 스코어) → al_select.py(전략별 N=500 선별) → cosmos_gate_lora_al_*.yaml(동일 하이퍼 FT) → eval_gate.py(bridge_test:val 다이얼) → analyze_al.py(Youden J). 산출: al_results.json · AL_LOOP.md.

NeMo AI 학습 솔루션 · Track B 데이터 해자 루프 · 2026-07-08 · measure-first, over-claim 없음