中文

关于理想对抗攻击的神经网络逼近与对抗训练的收敛性

机器学习 2023-08-01 v1 机器学习

摘要

对抗攻击通常表示为基于输入数据与模型的梯度的操作,这导致每次生成攻击时都需大量计算。本工作中,我们固化将对抗攻击表示为可训练函数而无需进一步梯度计算的思想。我们首先论证,在适当条件下,理论最优攻击可表示为光滑分段函数(分段 Hölder 函数)。随后我们得到此类函数由神经网络逼近的结果。接着,我们用神经网络模拟理想攻击过程,并将对抗训练化简为攻击网络与训练模型(防御网络)之间的数学博弈。我们还得到了该设定下对抗训练中关于样本量 nn 的对抗损失收敛速率。

关键词

引用

@article{arxiv.2307.16099,
  title  = {On Neural Network approximation of ideal adversarial attack and convergence of adversarial training},
  author = {Rajdeep Haldar and Qifan Song},
  journal= {arXiv preprint arXiv:2307.16099},
  year   = {2023}
}