分隔符注入攻击:揭示大语言模型因角色分隔符导致的对话偏差
计算与语言
2025-04-09 v1 密码学与安全
摘要
对话式大语言模型(LLM)因其指令遵循能力而广受关注。为确保对话式 LLM 遵循指令,常用于分隔对话中不同参与者的角色分隔符。然而,引入角色分隔符可能带来潜在漏洞。误用角色可能导致提示注入攻击,这些攻击容易使模型行为偏离用户意图,引发重大的安全问题。尽管已提出多种提示注入攻击,但近期研究大体忽视了角色分隔符对安全的影响。这凸显了需要彻底理解由角色分隔符引起的对话系统系统性弱点的紧迫性。本文识别由角色分隔符引起的建模弱点。具体而言,我们观察到角色分隔符与位置相关的强烈偏差,这种偏差是对话建模格式的内在特征,可通过插入角色分隔符来触发。我们进一步发展了基于角色分隔符的分隔符注入攻击(SIA)。实验结果表明,SIA 在提高人工方法效率方面效果显著,平均提升 18.2%,并通过自动方法将攻击成功率提升至 100%。
引用
@article{arxiv.2504.05689,
title = {Separator Injection Attack: Uncovering Dialogue Biases in Large Language Models Caused by Role Separators},
author = {Xitao Li and Haijun Wang and Jiang Wu and Ting Liu},
journal= {arXiv preprint arXiv:2504.05689},
year = {2025}
}