面向对话生成的白盒多目标对抗攻击
计算与语言
2023-05-09 v2 密码学与安全
机器学习
摘要
预训练 Transformer 在先进的对话生成(DG)系统中十分流行。然而,正如在文本分类等传统任务中所研究的那样,此类语言模型易受各种对抗样本的影响,这引发了我们对其在 DG 系统中鲁棒性的好奇。攻击 DG 模型的一个主要挑战是,对当前句子的扰动很难降低回复准确率,因为未改变的聊天历史也被用于决策。与仅追求 BLEU、ROUGE 等性能指标的下降不同,我们观察到构造对抗样本以迫使生成更长的输出有助于提升攻击效果——生成的回复通常无关、冗长且重复。为此,我们提出了一种称为 DGSlow 的白盒多目标攻击方法。具体而言,DGSlow 通过基于梯度的多目标优化器平衡生成准确率与长度两个目标,并采用自适应搜索机制以仅少量修改迭代构造对抗样本。在四个基准数据集上的综合实验表明,DGSlow 能以比传统基于准确率的方法更高的成功率显著降解最先进的 DG 模型。此外,我们构造的句子在攻击其他模型时也表现出很强的迁移性。
引用
@article{arxiv.2305.03655,
title = {White-Box Multi-Objective Adversarial Attack on Dialogue Generation},
author = {Yufei Li and Zexin Li and Yingfan Gao and Cong Liu},
journal= {arXiv preprint arXiv:2305.03655},
year = {2023}
}
备注
ACL 2023 main conference long paper