中文

面向转导学习所得神经网络鲁棒性的评估

机器学习 2022-02-18 v2

摘要

近来利用转导学习实现对抗鲁棒性引起了关注(Goldwasser 等,NeurIPS 2020;Wu 等,ICML 2020;Wang 等,ArXiv 2021)。相较于传统防御,这些防御机制基于测试时输入“动态学习”模型;且在理论上,攻击这些防御可归约为求解双层优化问题,这给构造自适应攻击带来困难。本文中,我们从原则性的威胁分析视角审视这些防御机制。我们 formulation 并分析了基于转导学习防御的威胁模型,指出若干重要细微之处。我们提出求解双层攻击目标的攻击模型空间原则,并给出贪婪模型空间攻击(GMSA),一种可作为评估基于转导学习防御新基线的攻击框架。通过系统评估,我们表明即便以弱实例化,GMSA 也能攻破先前基于转导学习的防御,而这些防御对先前的攻击(如 AutoAttack)具有韧性。在积极一面,我们报告了一个颇为令人惊讶的经验结果“转导对抗训练”:在测试时利用新鲜随机性对模型进行对抗重训练,可显著提升对我们所考虑攻击的鲁棒性。

关键词

引用

@article{arxiv.2110.14735,
  title  = {Towards Evaluating the Robustness of Neural Networks Learned by Transduction},
  author = {Jiefeng Chen and Xi Wu and Yang Guo and Yingyu Liang and Somesh Jha},
  journal= {arXiv preprint arXiv:2110.14735},
  year   = {2022}
}

备注

Paper published at ICLR 2022. arXiv admin note: text overlap with arXiv:2106.08387