中文

通过分布一致性 refinement 缓解大规模推理模型的安全税

人工智能 2026-02-03 v1

摘要

安全对齐会对大规模推理模型(LRM)的通用推理能力造成安全税。现有的LRM安全对齐数据集通常由从外部LRM或人类标注者提炼出的安全推理痕迹和答案构成。然而,这些推理痕迹和答案与目标LRM之间存在分布差异,我们推断这种分布差异是导致目标LRM推理能力显著下降的根本原因。基于此假设,我们提出了一种称为DGR的数据集构建方法。DGR将和细化现有的超分布安全推理数据集,使其与目标LLM内部分布一致。实验结果表明,i) DGR在保持所有基线安全性能的同时有效缓解了安全税,即在平均推理准确率上实现了DirectRefusal和R1-ACT分别提升了+30.2%和+21.2%;ii) 推理性能下降程度与分布偏移程度呈相关性,表明弥合这一差异是保持能力的关键。进一步地,我们发现LRM的安全对齐可能主要功能是激活潜在知识,因为仅需10个样本即可激活有效的拒绝行为。这些发现不仅凸显了分布一致性的重要性,也为理解推理模型的安全激活机制提供了启示。

关键词

引用

@article{arxiv.2602.02136,
  title  = {Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models},
  author = {Yingsha Xie and Tiansheng Huang and Enneng Yang and Rui Min and Wenjie Lu and Xiaochun Cao and Naiqiang Tan and Li Shen},
  journal= {arXiv preprint arXiv:2602.02136},
  year   = {2026}
}

备注

Code will be released soon