결과 — 선별 전략별 게이트 분리력 (Youden J)
교정(disagreement) 선별이 근소 우위 — 시뮬 라벨·단일시드·격차 노이즈 수준(아래 정정 참조)
disagreement@500
게이트판정≠라벨=점검자 교정
게이트판정≠라벨=점검자 교정
J 0.280
rec 81.6% · FP−46%
random@500
수동 baseline
수동 baseline
J 0.257
rec 64.2% · FP−62%
v3@1800 (참조)
무선별 4배 데이터
무선별 4배 데이터
J 0.243
rec 77.8% · FP−46%
uncertain@500
경계 불확실성 샘플링
경계 불확실성 샘플링
J 0.239
rec 79.7% · FP−44%
base (무FT)
게이트 재학습 전
게이트 재학습 전
J 0.203
rec 70.3% · FP−50%
J = 민감도(recall보존) + 특이도(FP감소) − 1. 게이트를 이진분류기로 볼 때 임계점 분리력. 모든 전략 동일 예산 N=500·동일 하이퍼(max_steps 120)·동일 검출인스턴스 350개로 평가 → 공정. held-out = 교량 시험셋 100장(학습 미노출, 검출 TP212/FP138).
표
동일 예산, 선별 전략만 변수
| 전략 (N) | recall보존 | FP감소 | Youden J | bal_acc |
|---|---|---|---|---|
| disagreement@500 | 81.6% | 46.4% | 0.280 | 0.640 |
| random@500 | 64.2% | 61.6% | 0.257 | 0.629 |
| v3@1800 (참조) | 77.8% | 46.4% | 0.243 | 0.621 |
| uncertain@500 | 79.7% | 44.2% | 0.239 | 0.620 |
| base (무FT) | 70.3% | 50.0% | 0.203 | 0.601 |
발견
이 실험이 말하는 것 (정직)
- ◐ 해자 메커니즘 시연(시뮬 라벨): '게이트판정 ≠ 라벨'인 교정 크롭을 선별해 재학습하는 루프가 배선되어 있고, 시뮬 라벨상 무선별 4배보다 근소 우위. 단 격차 노이즈 수준·단일시드라 성능 우위 아닌 메커니즘 시연. 제품이 이 신호를 이미 캡처한다(아래).
- ◐ 데이터 효율 가설: 시뮬상 선별 500개 ≳ 무선별 1800개(J 0.280 vs 0.243) — active selection이 라벨-효율적일 수 있다는 방향성 근거. 실 점검자 라벨·CI로 검증 필요.
- ✅ 모든 @500 전략이 base를 넘음 — 리뷰 크롭 재학습은 항상 게이트를 개선.
over-claim 안 함: 순수 불확실성 샘플링(uncertain)은 random을 하드판정 J로 이기지 못했다(0.239 vs 0.257). 작동하는 exploration 신호는 "경계 불확실성"이 아니라 "교정(disagreement)"이라는 것이 이 실험의 비자명한 결론. (uncertain·random은 운영점이 크게 달라 단일점 비교에 혼입 — 매칭-FP 다이얼 정합은 소형크롭 44/350 게이트불가로 부분 제한, 후속 과제.)
메커니즘 — 제품에 이미 배선됨
점검자 UX가 곧 최고가치 라벨 생성기
① 캡처
리뷰 → 라벨
점검 시 결함 크롭·게이트판정·보정 p_reject 저장. /feedback이 점검자 유지/제외를 라벨로 확정하고 agreement(게이트 vs 점검자)를 계산.
② 선별
교정 우선
al_select가 agreement=False(교정) 크롭을 우선 선별 — 실측상 최고가치. 시설·class 균형.
③ 재학습
시설별 어댑터
선별셋 → Cosmos LoRA(운영 프롬프트 동일) → HF PEFT 어댑터 hot-swap.
④ 측정
held-out 증명
학습 미노출 시험셋 다이얼로 개선을 항상 검증. 회귀 시 미채택.
경쟁사가 복제 못하는 이유는 알고리즘이 아니라 원천이다 — 현장 접근 + 점검자 노동으로만 나오는 교정 라벨. 우리 제품의 리뷰 UI가 그 원천을 자동 수집한다. 루프의 복리는 첫 유료 파일럿(실데이터 유입)부터 실현된다.
재현
pool_score.py(base 게이트 스코어) → al_select.py(전략별 N=500 선별) → cosmos_gate_lora_al_*.yaml(동일 하이퍼 FT) → eval_gate.py(bridge_test:val 다이얼) → analyze_al.py(Youden J). 산출: al_results.json · AL_LOOP.md.
NeMo AI 학습 솔루션 · Track B 데이터 해자 루프 · 2026-07-08 · measure-first, over-claim 없음