宁可稳妥勿后悔:以对抗训练防范欺骗性对手
机器学习
2021-12-14 v4
摘要
欺骗性攻击旨在通过轻微扰动正确标注训练样本的特征,大幅降低学习模型的测试准确率。通过将这种恶意攻击形式化为在特定 -Wasserstein 球内寻找最坏情况训练数据,我们表明在扰动数据上最小化对抗风险等价于优化原始数据上自然风险的上界。这意味着对抗训练可作为抵御欺骗性攻击的一种原则性防御手段。因此,欺骗性攻击造成的测试准确率下降可通过对抗训练大幅恢复。为进一步理解该防御的内在机制,我们揭示对抗训练能通过防止学习器在自然场景下过度依赖非鲁棒特征来抵御欺骗性扰动。最后,我们在流行基准数据集上辅以一组实验来补充我们的理论发现,结果表明该防御可抵御六种不同的实际攻击。理论与实证结果均支持在面对欺骗性对手时采用对抗训练。
引用
@article{arxiv.2102.04716,
title = {Better Safe Than Sorry: Preventing Delusive Adversaries with Adversarial Training},
author = {Lue Tao and Lei Feng and Jinfeng Yi and Sheng-Jun Huang and Songcan Chen},
journal= {arXiv preprint arXiv:2102.04716},
year = {2021}
}
备注
NeurIPS 2021