中文

SafeInfer:面向大型语言模型的上下文自适应解码时间安全对齐

计算与语言 2024-12-17 v2

摘要

安全对齐的人类语言模型往往表现出脆弱且不平衡的安全机制,增加了生成不安全内容的可能性。此外,通过编辑技术向语言模型引入新知识可能会进一步削弱安全性能。为此,我们提出了 SafeInfer,一种面向生成用户查询安全响应的上下文自适应解码时间安全对齐策略。SafeInfer 包含两个阶段:安全放大阶段采用安全示范示例调整模型的隐藏状态以增加更安全输出的可能性;以及安全引导解码阶段基于安全优化分布影响 token 选择,确保生成内容符合伦理规范。进一步,我们提出了 HarmEval,一种新颖的基准测试,用于广泛的安全评估,旨在根据领先 AI 技术巨头的政策,解决潜在滥用情景。

关键词

引用

@article{arxiv.2406.12274,
  title  = {SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models},
  author = {Somnath Banerjee and Sayan Layek and Soham Tripathy and Shanu Kumar and Animesh Mukherjee and Rima Hazra},
  journal= {arXiv preprint arXiv:2406.12274},
  year   = {2024}
}

备注

Accepted at AAAI 2025 (AI Alignment Track). Also selected for Microsoft Academic Partnership Grant (MAPG) 2024