GuidelineLLM:通过准则增强注意力与警觉性以应对有害内容
计算与语言
2025-04-15 v2 人工智能
摘要
尽管大型语言模型(LLM)具备对齐机制,但正越来越容易受到新兴越狱攻击的威胁,这些攻击可能削弱其对齐机制。这一漏洞对现实应用构成重大风险。现有工作在训练效率和泛化能力(即强化学习来自人类反馈和红队测试)方面面临挑战。开发有效策略以使LLM能够抵抗不断演变的越狱尝试 represents a significant challenge. 为此,我们提出了一种新型防御范式,称为GuidelineLLM,它帮助LLM识别可能包含有害内容的查询。在LLM作答之前,GuidelineLLM首先识别查询可能关联的风险,将这些风险总结为准则建议,然后将这些准则输入响应LLM。重要的是,我们的方法无需对LLM本身进行额外的安全微调;仅需微调GuidelineLLM。这一特征增强了GuidelineLLM在各种LLM上的通用适用性。实验结果表明,GuidelineLLM可以显著降低对LLM的攻击成功率(ASR),平均降低34.17%的ASR),同时保持LLM处理善意查询的实用性。代码已公开available at https://github.com/sqzhang-lazy/GuidelineLLM。
引用
@article{arxiv.2412.10423,
title = {Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM},
author = {Shaoqing Zhang and Zhuosheng Zhang and Kehai Chen and Rongxiang Weng and Muyun Yang and Tiejun Zhao and Min Zhang},
journal= {arXiv preprint arXiv:2412.10423},
year = {2025}
}
备注
AAAI 2025