ChatBug:由聊天模板诱导的对齐型大语言模型常见漏洞
密码学与安全
2025-01-08 v2 人工智能
机器学习
摘要
大语言模型 (LLM) 预期遵循用户指令并参与对话。增强 LLM 遵循指令能力的技术通常使用根据预定义聊天模板结构化的数据对其进行微调。尽管聊天模板被证明在优化 LLM 性能方面有效,但其对 LLM 安全对齐的影响尚不明了,这对于大规模安全部署 LLM 至关重要。本文我们研究聊天模板如何影响 LLM 的安全对齐。我们识别了由聊天模板引入的常见漏洞,命名为 ChatBug。我们识别 ChatBug 的关键洞察在于,聊天模板提供了一个必须由 LLM 遵循的刚性格式,但非用户。因此,恶意用户可能不会在提示 LLM 时遵循聊天模板。相反,恶意用户可利用对聊天模板的知识,据此设计提示以绕过 LLM 的安全对齐。我们开发了两种攻击以利用 ChatBug 漏洞。我们演示了恶意用户可有效利用八个最先进 (SOTA) 大语言模型的 ChatBug 漏洞,从而引出意外响应。此外,我们表明 ChatBug 可被现有越狱攻击利用以提高其攻击成功率。我们调查了针对 ChatBug 的潜在对策。我们的结果表明,尽管对抗训练有效缓解了 ChatBug 漏洞,但受害模型会出现显著性能下降。这些结果凸显了安全对齐与有用性之间的权衡。开发新方法以平衡这一权衡是未来研究的开放且关键方向。
引用
@article{arxiv.2406.12935,
title = {ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates},
author = {Fengqing Jiang and Zhangchen Xu and Luyao Niu and Bill Yuchen Lin and Radha Poovendran},
journal= {arXiv preprint arXiv:2406.12935},
year = {2025}
}
备注
This paper is accepted to AAAI 2025