提示鲁棒性:增强大语言模型对提示攻击的鲁棒性
计算与语言
2026-05-27 v2 人工智能
摘要
大语言模型(LLMs)通过有效利用提示策略,在各种任务中展现了卓越性能。然而,它们对输入扰动高度敏感,例如拼写错误或轻微的字符顺序错误,这些扰动可能显著损害其性能。尽管提示技术(如思维链 Chain-of-Thought 和自动提示生成)取得了进展,但开发一种能明确缓解此类扰动负面影响的提示策略仍然是一个开放性挑战。为弥补这一差距,我们提出了提示鲁棒性(Robustness of Prompting, RoP),这是一种旨在增强大语言模型鲁棒性的新型提示策略。RoP 包含两个阶段:错误纠正与引导。在错误纠正阶段,RoP 应用多种扰动方法生成对抗样本,用于自动纠正输入错误的提示。在引导阶段,RoP 基于纠正后的输入生成最优引导提示,引导模型生成更鲁棒、更准确的推理。通过涵盖算术、常识和逻辑推理任务的全面实验,我们证明了 RoP 显著提升了大语言模型对对抗扰动的鲁棒性。关键的是,与干净输入场景相比,它在仅造成最小精度退化的情况下保持了模型准确性,从而确立了 RoP 作为一种在现实应用中增强大语言模型鲁棒性的实用且有效的方法。
引用
@article{arxiv.2506.03627,
title = {Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks},
author = {Lin Mu and Guowei Chu and Li Ni and Lei Sang and Yiwen Zhang},
journal= {arXiv preprint arXiv:2506.03627},
year = {2026}
}
备注
Accepted by IEEE Transactions on Artificial Intelligence