迈向前沿安全政策 Plus
计算机与社会
2025-01-29 v1
摘要
本文审视了前沿安全政策(FSPs)的现状,结合能力进展以及政府行为者和AI安全研究人员对这些安全政策日益增长的期望进行了探讨。随后,本文主张FSPs应演进至更精细的版本,本文称之为FSPs Plus。与由部分前沿AI公司主导的第一波FSPs相比,FSPs Plus应围绕两大支柱构建。首先,FSPs Plus应采用前置能力作为一套全新、更清晰且更全面的指标。在这方面,本文建议国际或国内标准化机构制定高影响力能力前置组件的标准化分类法,供FSPs Plus随后参考采用。前沿模型论坛可通过在前沿AI开发者之间就该主题建立初步共识来发挥引领作用。其次,FSPs Plus应明确纳入AI安全案例,并在FSPs Plus与AI安全案例之间建立相互反馈机制。为建立这种相互反馈机制,FSPs Plus可进行更新,以明确承诺在开发和部署过程中的不同里程碑制定AI安全案例,根据AI安全案例的内容和置信度构建并采用安全措施,并在此基础上持续更新和调整FSPs Plus。
引用
@article{arxiv.2501.16500,
title = {Towards Frontier Safety Policies Plus},
author = {Matteo Pistillo},
journal= {arXiv preprint arXiv:2501.16500},
year = {2025}
}