中文

面向神经网络在对抗训练中的记忆效应

机器学习 2021-06-10 v1

摘要

近期研究表明,“记忆”是过参数化深度神经网络(DNNs)取得最优性能的一个重要因素。具体而言,完美拟合的 DNNs 可记忆许多非典型样本的标志,将其记忆泛化以正确分类测试非典型样本,并获得更好的测试性能。而通过对抗训练算法优化的 DNNs 也能通过记忆非典型样本及其对抗扰动样本的标志实现完美的训练性能。然而,对抗训练模型常遭受泛化能力差的问题,在测试集上干净准确率与鲁棒性均相对较低。本文研究对抗训练 DNNs 中记忆的效应,并揭示两个重要发现:(a)记忆非典型样本仅能有效提升 DNN 在干净非典型样本上的准确率,却几乎不能提升其对抗鲁棒性;(b)记忆某些非典型样本甚至会损害 DNN 在典型样本上的性能。基于这两点发现,我们提出良性对抗训练(BAT),可促使对抗训练避免拟合“有害”非典型样本,并尽可能拟合更多“良性”非典型样本。实验中我们验证了 BAT 的有效性,并表明在 CIFAR100 与 Tiny~ImageNet 等基准数据集上,其能取得优于基线方法的干净准确率—鲁棒性权衡。

关键词

引用

@article{arxiv.2106.04794,
  title  = {Towards the Memorization Effect of Neural Networks in Adversarial Training},
  author = {Han Xu and Xiaorui Liu and Wentao Wang and Wenbiao Ding and Zhongqin Wu and Zitao Liu and Anil Jain and Jiliang Tang},
  journal= {arXiv preprint arXiv:2106.04794},
  year   = {2021}
}

备注

Preprint, under submission