通过 Lead 偏差与影响函数对抽象式文本摘要模型的攻击
计算与语言
2024-10-29 v1 密码学与安全
摘要
大型语言模型为文本理解与生成引入了新的机遇。然而,它们容易受到对抗性扰动和数据投毒攻击的影响,尤其是在文本分类和翻译等任务中。然而,抽象式文本摘要模型的对抗鲁棒性仍较少被探索。在本工作中,我们揭示了一种新方法,通过利用摘要模型中固有的 lead 偏差来执行对抗性扰动。此外,我们引入了影响函数的一种创新应用以执行数据投毒,从而损害模型的完整性。该方法不仅表现出模型行为在产生预期结果上的偏斜,还展现出一种新的行为变化,即受攻击的模型倾向于生成抽取式摘要而非抽象式摘要。
引用
@article{arxiv.2410.20019,
title = {Attacks against Abstractive Text Summarization Models through Lead Bias and Influence Functions},
author = {Poojitha Thota and Shirin Nilizadeh},
journal= {arXiv preprint arXiv:2410.20019},
year = {2024}
}
备注
10 pages, 3 figures, Accepted at EMNLP Findings 2024