中文

面向对抗鲁棒性与可解释性的二阶优化

机器学习 2020-09-11 v1 机器学习

摘要

深度神经网络很容易被称为对抗攻击的小扰动所欺骗。对抗训练(AT)是一种旨在学习对此类攻击鲁棒的特征的技术,被广泛认为是一种非常有效的防御手段。然而,随着网络规模和输入维度的增长,这种训练的计算代价可能令人望而却步。受鲁棒性与曲率之间关系的启发,我们提出了一种新颖的正则化器,它通过对抗损失的一个二次近似来融合一阶和二阶信息。最坏情形二次损失通过一种迭代格式来近似。结果表明,我们的正则化器仅使用单次迭代即比先前的基于梯度和曲率的正则化方案取得更强的鲁棒性,避免了梯度混淆,并且通过额外迭代,以显著低于 AT 的训练时间取得强鲁棒性。此外,它保留了 AT 的一个有趣特性,即网络学习到的特征与人类感知高度对齐。我们通过实验证明,我们的方法比其他几何正则化技术产生更高质量的可供人类解释的特征。这些鲁棒特征随后被用于为模型预测提供人类友好的解释。

关键词

引用

@article{arxiv.2009.04923,
  title  = {Second Order Optimization for Adversarial Robustness and Interpretability},
  author = {Theodoros Tsiligkaridis and Jay Roberts},
  journal= {arXiv preprint arXiv:2009.04923},
  year   = {2020}
}

备注

7 pages, submitted