中文

SCANS:通过安全意识激活引导缓解 LLM 的夸大安全性问题

人工智能 2024-12-18 v2

摘要

安全对齐对于大语言模型(LLM)抵御恶意指令的威胁至关重要。然而,最近的研究揭示了对齐后的 LLM 倾向于因夸大安全性问题而拒绝良性查询,从而限制了其有用性。在本文中,我们提出了一种安全意识激活引导(SCANS)方法,以缓解对齐 LLM 中的夸大安全性问题。首先,SCANS 在激活空间中提取拒绝引导向量,并利用词汇投影来锚定一些影响模型拒绝行为的关键安全层。其次,通过追踪隐藏状态转换,SCANS 识别引导方向并相应地调整模型行为,在夸大安全性和充分安全性之间取得平衡。实验表明,SCANS 在 XSTest 和 OKTest 基准测试上取得了新的最先进性能,同时未损害其对有害查询的防御能力,并保持了几乎不变的模型能力。

关键词

引用

@article{arxiv.2408.11491,
  title  = {SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering},
  author = {Zouying Cao and Yifei Yang and Hai Zhao},
  journal= {arXiv preprint arXiv:2408.11491},
  year   = {2024}
}

备注

Extended version of paper accepted to AAAI 2025. 14 pages, 6 figures