安全税:安全对齐使大推理模型变得不那么合理
密码学与安全
2025-06-06 v2 人工智能
机器学习
摘要
安全对齐是大语言模型 (LLM) 正式部署前的重要步骤。虽然安全对齐在 LLM 中已被广泛研究,但对于配备了增强推理能力的大推理模型 (LRM),仍存在较大的研究空白。本文系统地考察了生成安全对齐 LRM 的简化流程。通过对多种 LRM 的评估,我们得到两个主要发现:(i) 可在 LRM 上进行安全对齐以恢复其安全能力;(ii) 安全对齐导致 LRM 推理能力的退化。这两个发现表明,在顺序 LRM 生成流程中,推理能力与安全能力之间存在权衡。我们将所发现的权衡命名为安全税 (Safety Tax),应能为未来 LRM 安全研究提供启示。作为副产品,我们整理了一个名为 DirectRefusal 的数据集,可作为安全对齐的替代数据集。我们的源代码可在 https://github.com/git-disl/Safety-Tax 获取。
引用
@article{arxiv.2503.00555,
title = {Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable},
author = {Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Zachary Yahn and Yichang Xu and Ling Liu},
journal= {arXiv preprint arXiv:2503.00555},
year = {2025}
}