中文

ForesightSafety Bench:面向安全 AI 的前沿风险评估与治理框架

人工智能 2026-03-02 v4 密码学与安全 计算机与社会

摘要

快速演进的 AI 展现出日益强大的自主性和目标导向能力,伴随着衍生的系统性风险,这些风险更加不可预测、难以控制且可能是不可逆的。然而,当前的 AI 安全评估系统存在关键局限性,如风险维度受限、前沿风险检测失效。滞后的安全基准和对齐技术几乎无法解决面向前沿 AI 模型所提出的复杂挑战。为弥合这一差距,本文提出 "ForesightSafety Bench" AI 安全评估框架, starting with 7 大基本安全支柱,逐步扩展至先进的具身 AI 安全、AI4Science 安全、社会和环境 AI 风险、灾难性和存在主义风险,以及 8 个关键工业安全领域,总计 94 个细化风险维度。到目前为止,该基准已累积数万个结构化风险数据点和评估结果,建立了一个覆盖面广、层次清晰、动态演化的 AI 安全评估框架。基于该基准,我们对二十多个主流的先进大模型进行系统性评估和深入分析,识别出关键风险模式及其能力边界。安全能力评估结果揭示了前沿 AI 在多个支柱中的广泛安全漏洞,尤其聚焦于风险型代理自主性、AI4Science 安全、具身 AI 安全、社会 AI 安全和灾难性/存在主义风险。本基准已发布于 https://github.com/Beijing-AISI/ForesightSafety-Bench。项目网站地址为 https://foresightsafety-bench.beijing-aisi.ac.cn/。

关键词

引用

@article{arxiv.2602.14135,
  title  = {ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI},
  author = {Haibo Tong and Feifei Zhao and Linghao Feng and Ruoyu Wu and Ruolin Chen and Lu Jia and Zhou Zhao and Jindong Li and Tenglong Li and Erliang Lin and Shuai Yang and Enmeng Lu and Yinqian Sun and Qian Zhang and Zizhe Ruan and Jinyu Fan and Zeyang Yue and Ping Wu and Huangrui Li and Chengyi Sun and Yi Zeng},
  journal= {arXiv preprint arXiv:2602.14135},
  year   = {2026}
}