是什么限制了胸部CT分类弱监督深度学习的性能?
图像与视频处理
2024-02-08 v1 机器学习
摘要
由于高质量疾病标签的稀缺,基于噪声数据的弱监督学习在医学成像界引起了关注。然而,对于此类弱监督学习的局限性以及这些约束对疾病分类性能的影响,人们知之甚少。在本文中,我们通过考察模型在三种条件下的容忍度来测试这种弱监督的效果。首先,我们通过在训练数据中逐步增加标签错误来考察模型对噪声数据的容忍度。其次,我们通过改变训练数据量来评估数据集大小的影响。第三,我们比较了二分类和多标签分类之间的性能差异。结果表明,在疾病分类性能下降之前,模型最多可容忍10%的附加标签错误。对于所有疾病类别,随着训练数据量的增加,疾病分类性能稳步上升,直到训练数据量达到75%时性能趋于平稳。最后,二分类模型在每个疾病类别中均优于多标签模型。然而,这种解释可能具有误导性,因为二分类模型受并发病的严重影响,可能并未学习到图像中该疾病的特定特征。总之,这项研究可能有助于医学成像界了解带有噪声标签的弱监督的益处和风险。此类研究表明,需要构建多样化的大规模数据集,并开发可解释且负责任的AI。
引用
@article{arxiv.2402.04419,
title = {What limits performance of weakly supervised deep learning for chest CT classification?},
author = {Fakrul Islam Tushar and Vincent M. D'Anniballe and Geoffrey D. Rubin and Joseph Y. Lo},
journal= {arXiv preprint arXiv:2402.04419},
year = {2024}
}
备注
16 pages , 8 figures. arXiv admin note: text overlap with arXiv:2202.11709