用于诊断视觉模型失效的合成设计实验
计算机视觉与模式识别
2026-05-05 v1 机器学习
摘要
当前的合成数据管道为计算机视觉生成图像时,缺乏对下游模型实际所需的诊断。这种闭环范式将合成数据视为廉价的真实数据,随机采样生成器的输出空间,希望覆盖模型的失效模式。我们认为这根本性地误用了合成数据独特的属性:场景因素的可控、独立变换。我们在统计理论基础上提出了代表性充分性的合成设计实验(Synthetic Designed Experiments for Representational Sufficiency, SDRS)。SDRS 将下游模型视为黑盒系统,将合成生成器视为实验设备。通过分数抽样设计,SDRS 通过 ANOVA 分解高效审计模型的因素灵敏度轮廓。它将失效分为两种可操作类型:类型 I 缺口( underrepresented factor 水平上的覆盖失效)和类型 II 缺口(对虚假 nuisance 依赖的失效)。审计后,SDRS 为解决每种缺口类型提供针对性合成数据。我们在三个实验中验证了 SDRS:(1)在 dSprites 上进行受控诊断实验,其中该审计正确识别了两种缺口类型,针对性数据将准确率从 49.9% 提升到 79.0%;(2)在程序化场景的密集分割任务中,通过检测背景复杂度捷径并应用针对性数据将 mIoU 从 0.948 提升到 0.998;(3)展示了 ANOVA 审计识别不完美生成器中跨因素污染的 entanglement 检测实验。最后,我们表明每因素不变性惩罚可以在因素之间传递灵敏度,揭示了一个在表示层面进行纠正的开放问题。
引用
@article{arxiv.2605.00832,
title = {Synthetic Designed Experiments for Diagnosing Vision Model Failure},
author = {Krisanu Sarkar},
journal= {arXiv preprint arXiv:2605.00832},
year = {2026}
}
备注
Under review at CVPR SynData4CV 2026