利用偏置正则化学习与域引导增强改善模型泛化性及对数据集偏置的鲁棒性
图像与视频处理
2019-11-15 v3 计算机视觉与模式识别
机器学习
摘要
深度学习随着生物医学大数据的出现而蓬勃发展。然而,不同机构获取的医疗数据集由于操作策略、机器协议、治疗偏好等各种混杂因素而具有固有偏置。因此,在一个数据集上训练的模型,无论数据量大小,都无法可靠地用于其他数据集。在本研究中,我们使用三个大规模胸部 X 光数据集考察了模型对数据集偏置的鲁棒性:首先,我们使用普通训练基线评估数据集偏置;其次,我们提出了一种新颖的多源域泛化模型,通过 (a) 设计新的偏置正则化损失函数;以及 (b) 合成新数据用于域增强。我们表明,在未见域的数据上,我们的模型在准确率和各种偏置度量方面显著优于基线及其他方法,且无需重新训练或微调。我们的方法通常适用于其他生物医学数据,为训练对偏置鲁棒的大数据分析与应用模型提供了新算法。演示训练代码已公开可用。
引用
@article{arxiv.1910.06745,
title = {Improve Model Generalization and Robustness to Dataset Bias with Bias-regularized Learning and Domain-guided Augmentation},
author = {Yundong Zhang and Hang Wu and Huiye Liu and Li Tong and May D Wang},
journal= {arXiv preprint arXiv:1910.06745},
year = {2019}
}
备注
9 pages, 5 figures