中文

基于动态调节对抗者的对抗微调

机器学习 2022-04-29 v1 人工智能 计算机视觉与模式识别

摘要

对抗训练是一种提升模型对恶意对抗攻击鲁棒性的有效方法。然而,这种模型鲁棒性的提升常导致在干净图像上标准性能的显著牺牲。在许多现实应用中,如健康诊断与自主手术机器人,标准性能比针对此类极端恶意攻击的模型鲁棒性更受重视。这引出一个问题:我们能在不牺牲标准性能的前提下将模型鲁棒性提升多少?本工作解决该问题,提出了一种简单而有效的基于迁移学习的对抗训练策略,解耦了对抗样本对模型标准性能的负面影响。此外,我们引入了一种训练友好的对抗攻击算法,其促进了对抗鲁棒性的提升且不引入显著训练复杂度。大量实验表明,所提方法在目标上优于先前的对抗训练算法:在保持模型于干净数据上标准性能的同时提升模型鲁棒性。

关键词

引用

@article{arxiv.2204.13232,
  title  = {Adversarial Fine-tune with Dynamically Regulated Adversary},
  author = {Pengyue Hou and Ming Zhou and Jie Han and Petr Musilek and Xingyu Li},
  journal= {arXiv preprint arXiv:2204.13232},
  year   = {2022}
}