通过图集成增强语言模型对抗变体攻击的鲁棒性
计算与语言
2024-04-19 v1 密码学与安全
摘要
预训练语言模型(PLM)在自然语言处理(NLP)中的广泛使用极大地提升了性能。然而,这些模型对对抗性攻击(例如,毒贩的伪装提示)的脆弱性,尤其是在具有丰富字符多样性和复杂结构的中文中,引发了重要担忧。在本研究中,我们提出了一种新方法——中文变体图增强(CHANGE),以提高PLM对中文内容中字符变体攻击的鲁棒性。CHANGE提出了一种将中文变体图融入PLM的新方法。通过设计利用图结构的多种辅助任务,CHANGE本质上增强了PLM对对抗性操纵文本的解释能力。在多种NLP任务上的实验表明,CHANGE在对抗对抗性攻击方面优于当前语言模型,并为鲁棒语言模型研究做出了宝贵贡献。这些发现为鲁棒语言模型奠定了基础,并凸显了图引导预训练策略在实际应用中的巨大潜力。
引用
@article{arxiv.2404.12014,
title = {Enhance Robustness of Language Models Against Variation Attack through Graph Integration},
author = {Zi Xiong and Lizhi Qing and Yangyang Kang and Jiawei Liu and Hongsong Li and Changlong Sun and Xiaozhong Liu and Wei Lu},
journal= {arXiv preprint arXiv:2404.12014},
year = {2024}
}
备注
12 pages, 4 figures, accepted by COLING 2024