中文

通过推理实现安全:推理护栏模型的实证研究

人工智能 2025-05-27 v1 计算与语言

摘要

基于推理的语言模型在各个领域均展现出强劲性能,其中在数学与编程任务上的提升最为显著。近期研究表明,推理对LLM安全与护栏应用同样具有显著益处。在本工作中,我们对用于内容审核的基于推理的护栏模型的训练进行了全面分析,重点关注推理时对自定义安全策略的泛化能力。我们的研究聚焦于两个关键维度:数据效率与推理效率。在数据方面,我们发现基于推理的模型展现出极强的样本效率,仅用显著少于非推理模型的训练样本即可实现具竞争力的性能。这为将剩余数据用于挖掘高价值困难样本以进一步提升模型性能解锁了潜力。在推理方面,我们通过引入推理预算来评估实际权衡,考察推理长度对延迟与准确性的影响,并探索双模训练以在运行时控制推理行为。我们的发现将为研究人员与开发者在真实世界系统中高效训练与部署基于推理的护栏模型提供实用见解。

关键词

引用

@article{arxiv.2505.20087,
  title  = {Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models},
  author = {Makesh Narsimhan Sreedhar and Traian Rebedea and Christopher Parisien},
  journal= {arXiv preprint arXiv:2505.20087},
  year   = {2025}
}