中文

2025年国际AI安全报告:第二次关键更新:技术安全措施与风险管理

计算机与社会 2025-11-26 v1

摘要

本次2025年国际AI安全报告的第二次更新,评估了过去一年中通用人工智能风险管理的最新进展。它审查了研究人员、公共机构和AI开发者如何应对通用人工智能的风险管理。在最近的几个月中,三家领先的AI开发者为其新模型应用了增强的安全措施,因为其内部的部署前测试无法排除这些模型可能被用于帮助制造生物武器的可能性。除了具体的预防性措施之外,还出现了一系列使AI模型和系统更可靠、更抗滥用的技术进展。这些包括对抗性训练、数据 curated和监控系统的新方法。与此同时,正在出现一批将这些技术能力制度化和形式化的制度框架:2025年发布前沿AI安全框架的公司数量翻了一翻,政府和国际组织已建立了少数针对通用人工智能的治理框架,主要关注透明度和风险评估。

关键词

引用

@article{arxiv.2511.19863,
  title  = {International AI Safety Report 2025: Second Key Update: Technical Safeguards and Risk Management},
  author = {Yoshua Bengio and Stephen Clare and Carina Prunkl and Maksym Andriushchenko and Ben Bucknall and Philip Fox and Nestor Maslej and Conor McGlynn and Malcolm Murray and Shalaleh Rismani and Stephen Casper and Jessica Newman and Daniel Privitera and Sören Mindermann and Daron Acemoglu and Thomas G. Dietterich and Fredrik Heintz and Geoffrey Hinton and Nick Jennings and Susan Leavy and Teresa Ludermir and Vidushi Marda and Helen Margetts and John McDermid and Jane Munga and Arvind Narayanan and Alondra Nelson and Clara Neppel and Gopal Ramchurn and Stuart Russell and Marietje Schaake and Bernhard Schölkopf and Alavaro Soto and Lee Tiedrich and Gaël Varoquaux and Andrew Yao and Ya-Qin Zhang and Leandro Aguirre and Olubunmi Ajala and Fahad Albalawi and Noora AlMalek and Christian Busch and André Carvalho and Jonathan Collas and Amandeep Gill and Ahmet Hatip and Juha Heikkilä and Chris Johnson and Gill Jolly and Ziv Katzir and Mary Kerema and Hiroaki Kitano and Antonio Krüger and Aoife McLysaght and Oleksii Molchanovskyi and Andrea Monti and Kyoung Mu Lee and Mona Nemer and Nuria Oliver and Raquel Pezoa and Audrey Plonk and José Portillo and Balaraman Ravindran and Hammam Riza and Crystal Rugege and Haroon Sheikh and Denise Wong and Yi Zeng and Liming Zhu},
  journal= {arXiv preprint arXiv:2511.19863},
  year   = {2025}
}