利用动态注意力提升基于 Transformer 的大语言模型的鲁棒性
计算与语言
2023-12-01 v2 密码学与安全
机器学习
摘要
基于 Transformer 的模型,如 BERT 和 GPT,因其卓越的性能已被广泛应用于自然语言处理(NLP)。然而,近期研究表明它们易受文本对抗攻击,即模型的输出可能被故意操纵的文本输入所误导。尽管已提出多种方法来增强模型鲁棒性并缓解此漏洞,但许多方法需要大量资源消耗(例如对抗训练)或仅提供有限保护(例如防御性 dropout)。本文中,我们提出一种称为动态注意力、专为 Transformer 架构定制的新方法,以增强模型自身针对各种对抗攻击的固有鲁棒性。我们的方法无需下游任务知识且不产生额外成本。所提出的动态注意力包含两个模块:(I)注意力修正,其对所选 token 的注意力值进行掩码或削弱;(ii)动态建模,其动态构建候选 token 集合。大量实验表明,动态注意力显著缓解了对抗攻击的影响,在广泛使用的对抗攻击下比先前方法性能提升高达 33%。动态注意力的模型级设计使其易于与其他防御方法(例如对抗训练)结合以进一步增强模型鲁棒性。此外,我们证明与其他动态建模方法相比,动态注意力保留了原始模型的最先进鲁棒性空间。
引用
@article{arxiv.2311.17400,
title = {Improving the Robustness of Transformer-based Large Language Models with Dynamic Attention},
author = {Lujia Shen and Yuwen Pu and Shouling Ji and Changjiang Li and Xuhong Zhang and Chunpeng Ge and Ting Wang},
journal= {arXiv preprint arXiv:2311.17400},
year = {2023}
}