评估与保护基于检索的情境学习的对抗鲁棒性
计算与语言
2024-10-10 v4 人工智能
摘要
随着大型语言模型(如 LLaMA 和 OpenAI GPT-3)的出现,情境学习(In-Context Learning, ICL)因其有效性和效率而受到广泛关注。然而,ICL 对编码演示在提示中使用的选择、顺序和 verbaliser 极其敏感。检索增强型 ICL 方法通过利用检索器提取语义相关示例作为演示来解决此问题。虽然这种方法会产生更准确的结果,但其对各种对抗攻击的鲁棒性——包括对测试样本、演示和检索数据的扰动——仍未得到充分探索。我们的研究揭示,检索增强模型在抵御测试样本攻击方面表现更好,攻击成功率(ASR)降低了 4.87%;然而,他们对演示攻击表现出自信过度,导致 ASR 增加 2%。对抗训练可以提高 ICL 方法抵御对抗攻击的鲁棒性;然而,在大型语言模型的上下文中,这种训练方案可能过于昂贵。作为一种替代方案,我们引入了一种有效的训练-free 对抗防御方法 DARD,通过丰富示例池中的受攻击样本来实现改进。我们表明 DARD 在性能和鲁棒性方面均取得改进,相较于基线方法可实现 ASR 降低 15%。我们发布代码和数据,以鼓励进一步研究:https://github.com/simonucl/adv-retreival-icl
引用
@article{arxiv.2405.15984,
title = {Evaluating and Safeguarding the Adversarial Robustness of Retrieval-Based In-Context Learning},
author = {Simon Yu and Jie He and Pasquale Minervini and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2405.15984},
year = {2024}
}
备注
COLM 2024, 31 pages, 6 figures