Sysformer:通过自适应系统提示保护冻结的大型语言模型
人工智能
2026-03-09 v2 计算与语言
机器学习
摘要
随着大型语言模型(LLMs)被部署在安全关键场景中,确保其响应符合安全标准至关重要。先前的研究表明,LLMs 往往无法理解安全行为的概念,导致对无害提示的不合理拒绝或生成有害内容。尽管已经做出了大量努力来提高其鲁棒性,但现有的防御措施通常依赖于昂贵的模型参数微调或采用次优的启发式技术。在这项工作中,我们采用一种新颖的方法来保护 LLMs,即学习在指令微调的 LLMs 中自适应系统提示。虽然 LLMs 通常被预训练以遵循固定的系统提示,但我们研究了针对每个特定用户输入量身定制系统提示对其响应安全性的影响。为此,我们提出了 ,一个 trans 模型,它在 LLM 输入嵌入空间中将初始 tem 提示更新为更鲁棒的系统提示,同时关注用户提示。在保持 LLM 参数冻结的情况下,Sysformer 被训练为拒绝响应一组有害提示,同时理想地响应一组安全提示。通过在来自不同家族的 个 LLM 和 个最新基准上的大量实验,我们证明 Sysformer 可以显著增强 LLM 的鲁棒性,使其对有害提示的拒绝率提高多达 ,同时对安全提示的遵从性提高多达 。结果还能很好地泛化到复杂的越狱攻击,使 LLM 针对不同攻击策略的鲁棒性提高多达 。我们希望我们的研究结果能带来更便宜的 LLM 保护方法,并激发未来对设计可变系统提示的探索。
引用
@article{arxiv.2506.15751,
title = {Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts},
author = {Kartik Sharma and Yiqiao Jin and Vineeth Rakesh and Yingtong Dou and Menghai Pan and Mahashweta Das and Srijan Kumar},
journal= {arXiv preprint arXiv:2506.15751},
year = {2026}
}
备注
ICLR 2026. Code available at https://github.com/Ksartik/sysformer