中文

R1-ACT:通过激活安全知识实现高效推理模型安全对齐

人工智能 2025-08-04 v1 计算与语言

摘要

尽管大型推理模型(LRM)在复杂任务上展现出惊人的能力,但近期研究表明,这些模型经常履行有害用户指令,引发重大安全顾虑。本文探讨了 LRM 安全风险的根本原因,发现模型已具备充分的安全知识,但在推理过程中未能激活它。基于这一洞察,我们提出了 R1-Act,一种简单高效的后训练方法,通过结构化推理过程显式触发安全知识。R1-Act 在保持推理性能的同时实现显著的安全提升,优于先前的对齐方法。值得注意的是,它仅需 1,000 个训练样本和 90 分钟的单张 RTX A6000 GPU 训练。广泛实验表明,该方法在多个 LRM Backbone 和规模方面具有稳健性、可扩展性和实际效率。

关键词

引用

@article{arxiv.2508.00324,
  title  = {R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge},
  author = {Yeonjun In and Wonjoong Kim and Sangwu Park and Chanyoung Park},
  journal= {arXiv preprint arXiv:2508.00324},
  year   = {2025}
}

备注

under review