中文

鲁棒泛化指南:架构、预训练与优化策略的影响

机器学习 2025-08-21 v1

摘要

在图像领域运行的深度学习模型面临小输入扰动的脆弱性。多年来,通过使用专门损失目标从头训练模型(即使用随机初始化)以追求对此类扰动的鲁棒性。最近,鲁棒微调 emerged as a more efficient alternative:即无需从头训练,而是对预训练模型进行适应,以最大化预测性能和鲁棒性。为进行鲁棒微调,实践者设计包括模型更新协议(如全更新或部分更新)和专门损失目标的优化策略。其他设计选择包括架构类型和规模,以及预训练表示。这些设计选择影响鲁棒泛化,即模型在测试时暴露于新颖且未见扰动时的性能维持能力。理解这些设计选择如何影响泛化仍是开放问题,具有重要实际意义。针对此问题,我们提出了一次实证研究,涵盖6个数据集、40个预训练架构、2种专门损失和3种适应协议,形成1,440种训练配置和7,200项鲁棒性测量,覆盖5种扰动类型。据我们了解,这是目前最为多样且全面的鲁棒微调基准。尽管注意力机制架构和鲁棒预训练表示日益流行,我们发现在大数据集上以监督方式预训练的卷积神经网络往往表现最佳。我们的分析既确认了又挑战了先前设计假设,突显有望的研究方向并提供实用指导。

关键词

引用

@article{arxiv.2508.14079,
  title  = {A Guide to Robust Generalization: The Impact of Architecture, Pre-training, and Optimization Strategy},
  author = {Maxime Heuillet and Rishika Bhagwatkar and Jonas Ngnawé and Yann Pequignot and Alexandre Larouche and Christian Gagné and Irina Rish and Ola Ahmad and Audrey Durand},
  journal= {arXiv preprint arXiv:2508.14079},
  year   = {2025}
}