中文

聚焦隐藏者:探索隐藏威胁以增强对抗训练

机器学习 2023-12-13 v1 密码学与安全 计算机视觉与模式识别 应用统计

摘要

对抗训练通常被表述为一个极小极大问题,然而,仅关注最差的对抗样本会导致模型出现交替重复的混淆,即在后续的对抗训练中,先前被防御或正确分类的样本变得无法防御或无法准确分类。我们将这类不可忽略的样本称为“隐藏者”,它们揭示了通过对抗训练获得的安全区域内的隐藏高风险区域,并阻止模型找到真正的最差情况。我们要求模型在防御对抗样本时阻止隐藏者,以同时提高准确性和鲁棒性。通过重新思考并重新定义对抗训练的极小极大优化问题,我们提出了一种称为聚焦隐藏者对抗训练(Hider-Focused Adversarial Training, HFAT)的广义对抗训练算法。HFAT 引入了迭代演化优化策略来简化优化问题,并采用辅助模型来揭示隐藏者,有效地结合了标准对抗训练和阻止隐藏者的优化方向。此外,我们引入了一种自适应加权机制,促使模型在不同的训练阶段在对抗样本和隐藏者之间自适应地调整其注意力。基于大量实验,我们证明了我们方法的有效性,并确保 HFAT 能够提供更高的鲁棒性和准确性。

关键词

引用

@article{arxiv.2312.07067,
  title  = {Focus on Hiders: Exploring Hidden Threats for Enhancing Adversarial Training},
  author = {Qian Li and Yuxiao Hu and Yinpeng Dong and Dongxiao Zhang and Yuntian Chen},
  journal= {arXiv preprint arXiv:2312.07067},
  year   = {2023}
}