中文

在数据稀缺的医学图像分割中合并数据时,可交换性是否优于独立同分布来处理数据分布偏移?

计算机视觉与模式识别 2026-02-27 v3 机器学习

摘要

数据稀缺是医学成像中的一个主要挑战,特别是对于深度学习模型。虽然数据合并(合并来自多个来源的数据集)和数据添加(从新数据集中添加更多数据)已被证明能提高模型性能,但它们并非没有复杂性。具体而言,通过合并或添加来增加训练数据集的大小会诱发分布偏移,对下游模型性能产生负面影响,这种现象被称为“数据添加困境”。虽然传统的独立同分布 (i.i.d.) 假设在多源背景下可能不成立,但假设跨数据集的可交换性为数据合并提供了一个更实用的框架。在这项工作中,我们研究了这些条件下的医学图像分割,借鉴因果框架的见解,提出了一种控制深度网络所有层中前景-背景特征差异的方法。这种方法改善了特征表示,这在数据添加场景中至关重要。我们的方法在五个数据集(包括我们整理并贡献的一个新型超声数据集)的组织病理学和超声图像上实现了最先进的分割性能。定性结果表明,与三种模型架构上的突出基线相比,分割图更精细且更准确。

关键词

引用

@article{arxiv.2507.19575,
  title  = {Is Exchangeability better than I.I.D to handle Data Distribution Shifts while Pooling Data for Data-scarce Medical image segmentation?},
  author = {Ayush Roy and Samin Enam and Jun Xia and Won Hwa Kim and Vishnu Suresh Lokhande},
  journal= {arXiv preprint arXiv:2507.19575},
  year   = {2026}
}

备注

MIDL 2026