中文

面向图像分类模型的反事实压力测试

计算机视觉与模式识别 2026-05-12 v1

摘要

医学成像中的深度学习模型在部署到新临床环境时常因人口统计学、扫描硬件或获取协议的分布迁移而失败。这一核心挑战是表述不足(underspecification),即在验证性能相似的模型 exhibit 出不同的实际失败模式。尽管压力测试(stress testing)已成为评估这一问题的工具,但当前方法通常依赖简单、无信息的扰动(如亮度或对比度变化),无法捕捉临床上真实的变异,可能会高估鲁棒性。本文引入基于因果生成模型的反事实压力测试框架,通过在扫描类型和患者性别等属性上进行干预,同时保持解剖身份不变,以创建真实的"what if"图像,从而实现在针对性分布迁移下的受控且语义上有意义的评估。我们在胸片和乳腺图像两个成像模态、三个模型架构和多个迁移场景上展示,反事实压力测试比经典扰动提供了更准确的真实 OOD 性能代理,捕捉到性能变化的方向和相对大小以及模型排序。这些结果表明,因果生成模型可作为评估医学 AI 系统部署前可靠性的实用模拟器,提供更可靠的评估依据。

关键词

引用

@article{arxiv.2605.10894,
  title  = {Counterfactual Stress Testing for Image Classification Models},
  author = {Moritz Stammel and Fabio De Sousa Ribeiro and Raghav Mehta and Mélanie Roschewitz and Ben Glocker},
  journal= {arXiv preprint arXiv:2605.10894},
  year   = {2026}
}