语义冗余训练数据剔除与深度模型分类性能:基于胸部X光的研究
计算机视觉与模式识别
2023-09-19 v1
摘要
深度学习(DL)已展现出从复杂多维数据中独立学习层次化特征的天然能力。一种普遍认知是其性能随训练数据量而提升。另一数据属性是内在多样性。因此,语义冗余(即相似或重复信息的存在)往往会降低性能并限制对未见数据的泛化能力。在医学影像数据中,语义冗余可因存在大量针对所关注疾病呈现高度相似表现的影像而产生。此外,DL训练中常用的增强方法在应用于语义冗余数据时可能限制性能。我们提出一种基于熵的样本评分方法,以识别并剔除语义冗余训练数据。利用公开可用的NIH胸部X光数据集,我们证明在所得信息性训练子集上训练的模型在内部测试(召回率:0.7164 vs 0.6597,p<0.05)与外部测试(召回率:0.3185 vs 0.2589,p<0.05)中均显著优于在全训练集上训练的模型。我们的发现强调了以信息为导向的训练样本选择相较于使用所有可用训练数据的常规做法的重要性。
引用
@article{arxiv.2309.09773,
title = {Semantically Redundant Training Data Removal and Deep Model Classification Performance: A Study with Chest X-rays},
author = {Sivaramakrishnan Rajaraman and Ghada Zamzmi and Feng Yang and Zhaohui Liang and Zhiyun Xue and Sameer Antani},
journal= {arXiv preprint arXiv:2309.09773},
year = {2023}
}
备注
3 Tables, 11 Figures, 20 pages