中文

大型推理模型的安全性:综述

计算与语言 2025-05-27 v3

摘要

大型推理模型凭借其先进的推理能力,在数学和编程等任务中展现出了非凡的能力。然而,随着这些能力的提升,关于其脆弱性和安全性的重大担忧也随之出现,这可能对其在现实世界环境中的部署和应用构成挑战。本文对大型推理模型进行了全面综述,细致地探索并总结了新出现的安全风险、攻击和防御策略。通过将这些要素组织成详细的分类体系,本工作旨在提供对大型推理模型当前安全态势的清晰且结构化的理解,促进未来的研究与开发,以增强这些强大模型的安全性和可靠性。

关键词

引用

@article{arxiv.2504.17704,
  title  = {Safety in Large Reasoning Models: A Survey},
  author = {Cheng Wang and Yue Liu and Baolong Bi and Duzhen Zhang and Zhong-Zhi Li and Yingwei Ma and Yufei He and Shengju Yu and Xinfeng Li and Junfeng Fang and Jiaheng Zhang and Bryan Hooi},
  journal= {arXiv preprint arXiv:2504.17704},
  year   = {2025}
}