通用对抗触发器
计算与语言
2026-05-19 v1 机器学习
摘要
最近的研究表明,现代 NLP 模型在情感分析、语言生成等多样化任务上训练后都会遭受到通用对抗攻击,这类攻击是一种输入无关的攻击方式,常用单一触发序列来攻击模型。尽管这些攻击成功,但由此生成的触发器在语法和自然性方面都不理想。我们提出了一种新方法,结合词性过滤和困惑度损失函数,以生成更通顺的触发器,使其更接近自然短语。对于情感分析任务,在 SST 数据集上,该方法产生的触发器可将正面预测翻转为负面,准确率分别降至 0.04 和 0.12。为构建鲁棒模型,我们还使用生成的触发器进行对抗训练,将模型准确率从 0.12 提升至 0.48。我们旨在说明,通过生成通顺的触发器,攻击可以难以被检测到,并且通过相关防御措施来促进稳健模型的开发。
引用
@article{arxiv.2605.17936,
title = {Universal Adversarial Triggers},
author = {Benedict Florance Arockiaraj and Alexander Feng and Jianxiong Cai and Xiaoyu Cheng},
journal= {arXiv preprint arXiv:2605.17936},
year = {2026}
}