TASA:通过孪生答案句攻击欺骗问答模型
计算与语言
2022-10-28 v1 人工智能
摘要
我们提出孪生答案句攻击(TASA),这是一种针对问答(QA)模型的对抗攻击方法,能够在保持正确答案的同时生成流畅且符合语法的对抗上下文。尽管通用对抗攻击取得了显著进展,但专门针对QA模型脆弱性和攻击的研究很少。本文首先探索现有模型中的偏差,发现它们主要依赖问题与上下文之间的关键词匹配,而忽略用于答案预测的相关上下文关系。基于上述两种偏差,TASA从两个方面攻击目标模型:(1)通过扰动答案句降低模型对正确答案的置信度;(2)通过干扰答案句误导模型选择错误答案。结合设计的束搜索和过滤方法,在五个QA数据集上的大量实验和人工评估中,TASA能够生成比现有文本攻击方法更有效的攻击,同时保持上下文质量。
引用
@article{arxiv.2210.15221,
title = {TASA: Deceiving Question Answering Models by Twin Answer Sentences Attack},
author = {Yu Cao and Dianqi Li and Meng Fang and Tianyi Zhou and Jun Gao and Yibing Zhan and Dacheng Tao},
journal= {arXiv preprint arXiv:2210.15221},
year = {2022}
}
备注
Accepted by EMNLP 2022 (long), 9 pages main + 2 pages references + 7 pages appendix