中文

欺骗问答模型:一种混合词级对抗方法

计算与语言 2024-11-14 v1 人工智能 机器学习

摘要

深度学习支撑着当前大多数先进的自然语言处理(NLP)任务,如文本分类、神经机器翻译(NMT)、抽象式摘要和问答(QA)。然而,这些模型,特别是问答模型,在面对对抗攻击时的鲁棒性是一个关键问题,但仍未得到充分探索。本文介绍了 QA-Attack(问答攻击),这是一种新颖的词级对抗策略,用于欺骗问答模型。我们基于注意力的攻击方法利用定制的注意力机制和删除排序策略来识别并定位上下文段落中的特定词语。它通过精心选择和替换同义词来创建欺骗性输入,在保持语法完整性的同时,误导模型产生错误的回答。我们的方法在各种问题类型上展现了通用性,尤其是在处理长文本输入时。在多个基准数据集上的大量实验表明,QA-Attack 成功欺骗了基线问答模型,并在成功率、语义变化、BLEU 分数、流畅度和语法错误率方面超越了现有的对抗技术。

关键词

引用

@article{arxiv.2411.08248,
  title  = {Deceiving Question-Answering Models: A Hybrid Word-Level Adversarial Approach},
  author = {Jiyao Li and Mingze Ni and Yongshun Gong and Wei Liu},
  journal= {arXiv preprint arXiv:2411.08248},
  year   = {2024}
}