中文

对抗修正才是将敌人化为朋友的唯一力量

人工智能 2023-05-19 v1 密码学与安全 计算机视觉与模式识别

摘要

对抗攻击因误导行为常被视作对神经网络的巨大威胁。本文提出相反视角:若加以正确修正,对抗攻击可被用以改进神经模型。不同于旨在提升对抗鲁棒性的传统对抗防御或对抗训练方案,所提对抗修正(AdvAmd)方法旨在提升神经模型在良性样本上的原始准确率水平。我们深入分析了良性样本与对抗样本间的分布失配。该分布失配以及现有防御策略中采用的等学习率互学习机制,是导致良性样本准确率下降的主因。所提AdvAmd被证明能稳定修复准确率下降,甚至使常见神经模型在良性分类、目标检测与分割任务上获得一定准确率提升。AdvAmd的有效性源于三个关键组件:中介样本(通过细粒度修正降低分布失配影响)、辅助批归一化(解决互学习机制与更平滑判断面)以及AdvAmd损失(依据不同攻击脆弱性调整学习率),以上经定量与消融实验证实。

关键词

引用

@article{arxiv.2305.10766,
  title  = {Adversarial Amendment is the Only Force Capable of Transforming an Enemy into a Friend},
  author = {Chong Yu and Tao Chen and Zhongxue Gan},
  journal= {arXiv preprint arXiv:2305.10766},
  year   = {2023}
}

备注

Accepted to IJCAI 2023, 10 pages, 5 figures