immersivecast · imai × imsim — 데이터 엔진

합성 데이터가 실제 검출을 예측한다 — sim2real 랭크 성립

디지털 트윈(imsim)이 만든 합성 크랙이 실제 검출 난이도의 순위를 완벽히 예측함을, 코드로 강제된 가드레일과 해시 봉인으로 증명했습니다. "합성으로 순위·난이도를 예측해 실데이터 취득과 모델 우선순위를 정한다"는 플랫폼 가치의 첫 정본 실증입니다.

2026-07-19 · 등록 해시 1732c3ff · 근거: strategy/IMSIM_COLLAB_PLAN.md

결론

ρ = 1.00
raw·층화 모두 (p<0.0001) · 견고성: 런 재표집 1,989회 ρ≥0.7 유지 100% · leave-one-run-out 5/5 0.90~1.00
상태 = 랭크-성립 · 레벨 낙관 — sim은 검출 난이도의 순위를 완벽히 예측하나, 절대 검출률은 실제보다 낙관적(sim이 4/5밴드 +0.07~0.21 쉬움).

어떻게 도달했나 — 흉내가 아니라 같은 물리

텍스처로 "속이는" 접근은 진짜 데이터로 학습된 검출기를 못 속였습니다. 물리로 전환하고서야 성립했습니다.

텍스처 레버 4종 전패 진짜 검출기 정직 심판(갭 0.4) 물리 변위 mesh(V-groove·RTX) 표적 취득 ρ=1.00 성립

정직성을 코드로 강제 — 가드레일 4조

문서 약속이 아니라, 엔진이 위반을 거부합니다.

가드레일강제 방식
G1 사전등록스트라타·타깃 구성을 판정 전 SHA 봉인 — 사후 튜닝 시 판정 fail-loud 거부
G2 가중 출처타깃 구성은 실 앵커에서만 유도 — 실행 시점 대조, 불일치 중단
G3 병기·공개raw ρ와 층화 ρ 항상 함께 방출 + 구성표 전량 공개
G4 최소 셀표본 부족 셀은 가중 제외 + 제외 목록 공개

벤더 무관 — 특정 모델의 quirk가 아니다 확정

검출 난이도가 특정 모델 탓이 아님을, 최대한 다른 3종 검출기로 확인했습니다.

난이도 인자U-Net(학습)SegFormer(타 아키텍처·제3자)고전 CV(무학습)판정
불연속0.1490.116~0.2400.104보편
파편화0.1210.116~0.2400.110보편

코드·학습 데이터를 공유하지 않는 세 방법이 같은 크랙을 같은 방식으로 어려워합니다. 하드 크랙(불연속·파편화)은 어떤 검출기에도 본질적으로 어렵다는 뜻 — 우리 분석·성능이 특정 벤더에 종속되지 않음의 실증입니다.

난이도 인과 분해 — sim이 관찰 데이터로 못 가르는 걸 가른다

통제 실험으로 각 인자의 인과 효과를 분리: 불연속 0.363 · 파편화 0.326(지배) · 오염/흐림 미미. 실 유병률과 곱하면 레벨 갭의 50%를 정량 설명합니다("현장에 파편 크랙 10% → 검출률 3.3%p 하락"). ★파편화는 실 관찰 데이터로는 표본 부족(n=2)으로 못 가렸으나 sim 통제 실험이 가려냈습니다 — 데이터 엔진 가치 명제의 첫 사례.
정직 경계. sim은 순위 예측용입니다. 절대 검출률은 낙관 편향(실제보다 쉬운 조건)이 확인됐으므로 성능·계약에 sim 절대 수치를 인용하지 않습니다 — 절대 성능의 정본은 항상 실 held-out입니다. 레벨 갭의 나머지 50%(강도 스윕·배경 혼동)는 백로그입니다.

사업적 의미

이 실증이 여는 것: 데이터가 희소한 결함·시설·위험에서 합성으로 난이도 지도를 만들어 "어디를 더 취득하고 어느 모델을 우선할지"를 정할 수 있습니다. 크랙은 첫 도미노 — 같은 방법론이 화재·다중결함·타 시설로 확장됩니다. 단, 판매 성능은 언제나 실측 정본으로.