中文

模型报告对其化学与生物基准评估说了什么?将近期发布与STREAM框架进行比较

计算机与社会 2025-10-29 v2

摘要

大多数前沿人工智能开发者在模型报告中公开记录其对新AI模型的安全评估,包括针对化学与生物(ChemBio)滥用风险的测试。这种做法为了解这些评估的方法论提供了一个窗口,有助于建立公众对AI系统的信任,并使得在仍处于萌芽阶段的AI评估科学中能够进行第三方审查。但是,开发者目前在其报告中包含(或遗漏)了评估方法论的哪些方面?本文考察了2025年春季发布的三份前沿AI模型报告,这些报告拥有最详细的文档:OpenAI的o3、Anthropic的Claude 4和Google DeepMind的Gemini 2.5 Pro。我们使用STREAM(v1)标准(用于报告ChemBio基准评估)对这些报告进行了比较。每份模型报告都包含了一些其他报告所没有的有用细节,并且所有模型报告都被发现存在有待改进之处,这表明开发者可以从采纳彼此的最佳报告实践中受益。我们识别出若干在所有模型报告中报告均不够完善的项目,例如提供测试材料的示例,以及包含详细的诱发条件列表。总体而言,我们建议AI开发者继续加强新兴的评估科学,在目前报告仍然有限的领域努力提高透明度。

关键词

引用

@article{arxiv.2510.20927,
  title  = {What do model reports say about their ChemBio benchmark evaluations? Comparing recent releases to the STREAM framework},
  author = {Tom Reed and Tegan McCaslin and Luca Righetti},
  journal= {arXiv preprint arXiv:2510.20927},
  year   = {2025}
}

备注

12 pages, 6 figures. Includes appendices Added supplementary materials