中文

scaffolding下的安全性:评估条件如何塑造测量的安全性

软件工程 2026-03-12 v1 人工智能 计算与语言 机器学习

摘要

安全基准在孤立环境中评估语言模型,通常使用多选格式;而实际部署将这些模型包装在具有推理痕迹、批评代理和委派管道的代理式 scaffolding 中。我们报告了规模为 62,808、包含六个前沿模型和四种部署配置的规模化受控研究,探讨了 scaffolding 对安全性的影响,结合了预注册、评估者盲测、等效性测试和规格曲线分析。映射-归约型 scaffolding 会降低测量的安全性(NNH = 14),但其中三种 scaffolding 架构中有两种在实际意义上的容差内保持了安全性。调查映射-归约导致的退化,揭示了更深层的测量问题:从多选格式切换到开放式格式在相同题目上会使安全得分偏移 5-20 个百分点,这超过了任何 scaffolding 效应。在规格内的比较中,scaffold 架构的比较在我们的预先注册的 +/-2 pp TOST 容差内与实际等效,表明评估格式而非 scaffolding 架构是起作用变量。模型与 scaffolding 的相互作用跨 35 pp,呈单向或双向变化(一个模型在映射-归约下因迎合症而降低 16.8 pp,另一个模型在相同基准上提升 18.8 pp),排除了关于 scaffolding 安全性的普遍主张。一般化分析得出 G = 0.000:模型安全性排名在基准之间完全反转,以至于没有任何组合安全指数实现非零可靠性,表明每模型、每配置的测试是必要的最低标准。我们发布所有代码、数据和提示词作为 ScaffoldSafety。

关键词

引用

@article{arxiv.2603.10044,
  title  = {Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety},
  author = {David Gringras},
  journal= {arXiv preprint arXiv:2603.10044},
  year   = {2026}
}

备注

74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding