中文

深度神经网络图像分类器中数据重复的影响:鲁棒 vs 标准模型

机器学习 2026-03-19 v3 人工智能 图像与视频处理

摘要

机器学习模型的准确性和对对抗攻击的鲁棒性受到诸多因素的影响,包括训练数据质量、模型架构、训练过程以及部署环境。在近年来,尤其是在语言模型中,训练集中的重复数据引起了广泛关注。已证明去重可提高语言模型的训练性能和模型准确性。尽管在训练图像分类深度神经网络 (DNN) 时,数据质量的重要性已广为人知,但关于训练集中重复图像对模型泛化和性能影响的研究仍鲜有涉及。本文填补了这一空白,提供了对图像分类中重复数据影响的全面研究。我们的分析表明,训练集中存在重复图像不仅会降低模型训练效率,还可能导致图像分类器的准确性下降。这种重复对准确性的负面影响在重复数据在类别间非均匀分布时尤为明显,或在对抗训练模型的训练集中发生重复(无论是均匀还是非均匀)时更为明显。即使重复样本被均匀选择,增加重复量也不会显著提高准确性。

关键词

引用

@article{arxiv.2504.00638,
  title  = {Impact of Data Duplication on Deep Neural Network-Based Image Classifiers: Robust vs. Standard Models},
  author = {Alireza Aghabagherloo and Aydin Abadi and Sumanta Sarkar and Vishnu Asutosh Dasu and Bart Preneel},
  journal= {arXiv preprint arXiv:2504.00638},
  year   = {2026}
}