中文

安全不仅仅是拒绝:面向可解释LLM安全的推理增强微调

计算与语言 2025-10-01 v2 密码学与安全

摘要

大语言模型(LLMs)容易受到越狱攻击的攻击,这些攻击利用了传统安全对齐中的弱点,传统安全对齐通常依赖僵化的拒绝启发式或表示工程来阻止有害输出。虽然它们对直接对抗攻击有效,但它们在需要细致、上下文感知决策的更广泛安全挑战方面表现不足。为此,我们提出了推理增强微调以实现可解释LLM安全(Rational),这是一种训练模型在响应之前进行显式安全推理的新型框架。微调后的模型利用广泛预训练知识中的自生成推理,通过结构化推理启动自身安全,内化上下文敏感的决策。我们的发现表明,安全不仅限于拒绝,还需要上下文感知以实现更鲁棒、可解释和自适应的响应。推理不仅是LLM的核心能力,也是LLM安全的基本机制。Rational采用推理增强微调,使其能够在拒绝有害提示的同时,在复杂场景中提供有意义且上下文感知的响应。

关键词

引用

@article{arxiv.2503.05021,
  title  = {Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety},
  author = {Yuyou Zhang and Miao Li and William Han and Yihang Yao and Zhepeng Cen and Ding Zhao},
  journal= {arXiv preprint arXiv:2503.05021},
  year   = {2025}
}

备注

ACL 2025 Findings