ForAug:通过前景与背景重组改善视觉Transformer训练并缓解偏置
计算机视觉与模式识别
2025-12-01 v3 人工智能
机器学习
摘要
Transformer,特别是视觉Transformer(ViTs),在大规模图像分类中取得了最先进的性能。然而,它们通常需要大量数据,并且可能表现出偏置,如中心偏置或尺寸偏置,从而限制了其鲁棒性和泛化能力。本文介绍了ForAug,一种新型数据增强操作,通过在训练数据中显式施加不变性来解决这些挑战,而这些不变性否则是神经网络架构的一部分。ForAug通过使用预训练基础模型分离并重组前景物体与不同背景来构建。这种重组步骤使我们能够对物体位置和尺寸进行细粒度控制,以及背景选择。我们证明,使用ForAug显著提高了ViTs和其他架构在ImageNet上的准确率,最高提升4.5个百分点(p.p.),在下游任务上提升7.3 p.p.。重要的是,ForAug不仅提高了准确率,还开辟了分析模型行为和量化偏置的新途径。即,我们引入了背景鲁棒性、前景聚焦、中心偏置和尺寸偏置的指标,并表明在训练期间使用ForAug显著减少了这些偏置。总之,ForAug为分析和缓解偏置提供了有价值的工具,使开发更鲁棒和可靠的计算机视觉模型成为可能。我们的代码和数据集在 https://github.com/tobna/ForAug 上公开发布。
引用
@article{arxiv.2503.09399,
title = {ForAug: Recombining Foregrounds and Backgrounds to Improve Vision Transformer Training with Bias Mitigation},
author = {Tobias Christian Nauen and Brian Moser and Federico Raue and Stanislav Frolov and Andreas Dengel},
journal= {arXiv preprint arXiv:2503.09399},
year = {2025}
}
备注
v2: added DeiT, added ablation vs simple copy-paste