如何零样本/少样本演示影响基于提示的大语言模型越狱攻击防御
计算与语言
2026-02-05 v1 人工智能
密码学与安全
摘要
大型语言模型(LLMs)面临着日益增加的越狱攻击威胁,这类攻击能够绕过安全对齐措施。虽然基于提示的防御方法,如角色导向提示(Role-Oriented Prompts, RoP)和任务导向提示(Task-Oriented Prompts, ToP)已显示出有效性,但少量演示在这些防御策略中的作用仍不明确。先前的研究表明,少量示例可能削弱安全性,但缺乏对少量示例如何与不同系统提示策略相互作用的深入研究。本文在四个安全基准(AdvBench、HarmBench、SG-Bench、XSTest)上,对六种越狱攻击方法进行了在多个主流大语言模型上的全面评估。我们的关键发现表明,少量演示对RoP和ToP产生相反的效果:少量演示通过强化角色身份,使RoP的安全性提升最高可达4.5%;而它会通过分散注意力离开任务指令,使ToP的有效性下降最高可达21.2%。基于这些发现,我们提供了在实际大语言模型应用中部署基于提示的防御的实用建议。
引用
@article{arxiv.2602.04294,
title = {How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks},
author = {Yanshu Wang and Shuaishuai Yang and Jingjing He and Tong Yang},
journal= {arXiv preprint arXiv:2602.04294},
year = {2026}
}
备注
13 pages, 4 figures, 6 tables