通过自去噪平滑提升大语言模型的鲁棒性
计算与语言
2024-04-19 v1 人工智能
摘要
尽管大型语言模型(LLM)取得了显著成功,但它们对对抗扰动(包括最近的越狱攻击)的脆弱性引起了相当大的关注。然而,这些模型日益增长的规模以及对其访问的限制使得提高其鲁棒性成为一项具有挑战性的任务。在各种防御策略中,随机平滑对LLM显示出巨大潜力,因为它不需要完全访问模型参数或通过对抗训练进行微调。然而,随机平滑涉及在模型预测之前向输入添加噪声,最终模型的鲁棒性在很大程度上取决于模型在这些噪声损坏数据上的性能。其有效性通常受到模型在噪声数据上次优性能的限制。为了解决这个问题,我们提出利用LLM的多任务特性,首先对噪声输入进行去噪,然后基于这些去噪版本进行预测。我们将此过程称为自去噪平滑。与计算机视觉中先前需要训练单独模型来增强LLM鲁棒性的去噪平滑技术不同,我们的方法提供了显著更好的效率和灵活性。我们的实验结果表明,在防御针对下游任务和人类对齐(即越狱攻击)的对抗攻击方面,我们的方法在经验鲁棒性和认证鲁棒性上都超越了现有方法。我们的代码可在 https://github.com/UCSB-NLP-Chang/SelfDenoise 公开获取。
引用
@article{arxiv.2404.12274,
title = {Advancing the Robustness of Large Language Models through Self-Denoised Smoothing},
author = {Jiabao Ji and Bairu Hou and Zhen Zhang and Guanhua Zhang and Wenqi Fan and Qing Li and Yang Zhang and Gaowen Liu and Sijia Liu and Shiyu Chang},
journal= {arXiv preprint arXiv:2404.12274},
year = {2024}
}
备注
Accepted by NAACL 2024. Jiabao, Bairu, Zhen, Guanhua contributed equally. This is an updated version of the paper: arXiv:2307.07171