中文

分布对抗训练中的基本权衡

机器学习 2021-01-19 v1 统计理论 机器学习 统计理论

摘要

对抗训练是提高模型对抗对抗扰动鲁棒性最有效的技术之一。然而,该方法对模型的全面影响尚不清楚。例如,虽然对抗训练能降低对抗风险(针对攻击者的预测误差),它有时会增加标准风险(无攻击者时的泛化误差)。更进一步,此类行为受学习问题多种因素影响,包括训练数据规模与质量、输入中对抗扰动的具体形式、模型过参数化以及攻击者能力等。本文关注\emph{分布扰动}对手框架,其中对手可在训练数据分布的邻域内改变测试分布。邻域通过分布间的 Wasserstein 距离定义,邻域半径衡量对手的操纵能力。我们研究标准风险与对抗风险间的权衡,并在特征维度固定、无限数据极限下,推导在特定模型类上可实现的帕累托最优权衡。我们考虑三种学习设定:1)线性模型类的回归;2)高斯混合数据模型下、线性分类器类的二分类;3)随机特征模型类(等价于首层权重随机的两层神经网络)的回归。我们展示三种设定中均显现标准与对抗风险的权衡。我们进一步刻画帕累托最优权衡曲线,并讨论特征相关性、对手能力或两层神经网络宽度等因素如何影响该权衡。

关键词

引用

@article{arxiv.2101.06309,
  title  = {Fundamental Tradeoffs in Distributionally Adversarial Training},
  author = {Mohammad Mehrabi and Adel Javanmard and Ryan A. Rossi and Anup Rao and Tung Mai},
  journal= {arXiv preprint arXiv:2101.06309},
  year   = {2021}
}

备注

23 pages, 3 figures