合成简单性:揭示医学数据增强中的偏差
计算机视觉与模式识别
2024-12-23 v1 人工智能
摘要
合成数据正变得越来越在数据稀缺领域(如医学成像)中至关重要,常被用作真实数据的替代品。然而,其内在的统计特征可能显著影响下游任务,potentially 损害部署性能。在本研究中,我们实证性地调查了这一问题,并发现了一个关键现象:当数据来源与任务标签之间存在强相关性时,下游神经网络往往会利用数据来源与真实数据之间的虚假区别。这种利用表现为‘简单性偏差’,即模型过度依赖表面特征而非真正的任务相关复杂性。通过原则实验,我们展示了数据来源(真实 vs. 合成)可能引入伪相关因素,导致在相关性消失时部署时性能下降。我们首先在一个数字分类任务中演示了这一脆弱性,模型可谈情绪地利用数据来源而非数字本身提供推断。我们进一步在与心脏视图分类相关的医学成像问题中提供了进一步的证据,尤其是区分 2 chamber 和 4 chamber 视图。在不断发挥作用的合成数据集日益增长的背景下,我们希望我们的实验能为医学数据集的训练提供有效指南。
引用
@article{arxiv.2407.21674,
title = {Synthetic Simplicity: Unveiling Bias in Medical Data Augmentation},
author = {Krishan Agyakari Raja Babu and Rachana Sathish and Mrunal Pattanaik and Rahul Venkataramani},
journal= {arXiv preprint arXiv:2407.21674},
year = {2024}
}