中文

安全本能:LLMs 学习信任内在精神进行自我防御

人工智能 2025-10-02 v1

摘要

确保大型语言模型(LLM)的安全性仍然具有挑战性,因为缺乏通用标准和可靠的内容验证器,导致难以获得有效的训练信号。我们发现,对齐的模型已经具备健全的内部安全信念:它们一致地对有害请求产生高置信度的拒绝,同时在生成潜在危险内容时表现出高熵。这种熵差暴露了一种未被充分利用的信号——模型“内在地知道”何时拒绝。我们引入了安全本能强化学习(Safety Instincts Reinforcement Learning, SIRL),将这种内部置信度转化为自生成的奖励信号,消除对外部验证器或人工标注的依赖。SIRL 通过强化低熵拒绝行为教导模型信任其安全本能。评估于 Llama 和 Qwen 模型,SIRL 在针对 20 多种 jailbreak 方法(从静态提示到自适应攻击)时保持 89% 以上的防御成功率(Defense Success Rates, DSRs)。仅使用 15,000 条无标签提示,SIRL 就超越了资源密集型的监督方法,同时在数学、编码和对话基准测试中保持性能。我们的工作表明,有效的对齐可以从内部涌现,为更自主和稳健的 AI 安全机制铺平了道路,这些机制能够在不 extensively 人工监督的情况下实现规模化。

关键词

引用

@article{arxiv.2510.01088,
  title  = {Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense},
  author = {Guobin Shen and Dongcheng Zhao and Haibo Tong and Jindong Li and Feifei Zhao and Yi Zeng},
  journal= {arXiv preprint arXiv:2510.01088},
  year   = {2025}
}