中文

高效鲁棒化预训练模型

计算机视觉与模式识别 2023-09-15 v1

摘要

深度学习算法近期趋势倾向于训练大规模模型,即高参数量且在大数据集上训练。然而,此类大规模模型面向真实世界设置的鲁棒性仍是较少被探索的课题。本工作中,我们首先在不同扰动和数据集(从而代表真实世界偏移)下对这些模型进行基准测试,并凸显它们在这些偏移下性能的退化。接着我们讨论,基于完整模型微调的现有鲁棒化方案鉴于极大规模网络可能并非可扩展之选,且可能导致其遗忘某些期望特性。最后,受知识迁移文献启发,我们提出一种简单且经济的方法来解决该问题。该方法以较低计算成本鲁棒化较小模型,并将其作为教师来调优这些大规模网络的一部分,从而降低整体计算开销。我们在包括 ImageNet-C、R、S、A 数据集的多种视觉扰动下,以及不同数据集的迁移学习、零样本评估设置中评估所提方法。基准结果表明,我们的方法能高效地为这些大规模模型注入鲁棒性,所需时间显著更少,且保留了原模型的迁移学习、零样本属性,而现有方法均无法实现。

关键词

引用

@article{arxiv.2309.07499,
  title  = {Efficiently Robustify Pre-trained Models},
  author = {Nishant Jain and Harkirat Behl and Yogesh Singh Rawat and Vibhav Vineet},
  journal= {arXiv preprint arXiv:2309.07499},
  year   = {2023}
}