SpecEval:评估模型对行为规范的遵循程度
计算与语言
2025-10-24 v2
摘要
开发基础模型的公司会发布其承诺模型遵循的行为准则,但实际模型是否如此仍不明确。虽然 OpenAI、Anthropic 和 Google 等提供方已发布详细的规范,描述了既定的安全约束及定性特征,但尚无对这些准则遵循情况的系统审计。我们引入一个自动化框架,通过解析行为声明、生成针对性提示并利用模型对遵循情况进行评判来审计模型是否符合其提供方的规范。我们的核心关注点是提供方规范、模型输出及其自身作为评判模型之间的三方一致性;这是对先前基于生成器-验证器两方一致性的延伸。这构成了必要的基准:至少,基础模型在由开发商评判模型的评判器作用下,应能持续满足开发商的行为规范。我们将该框架应用于来自六家开发商的 16 个模型,涉及超过 100 条行为声明,发现系统性不一致情况,其中包括跨提供方的合规差距最高可达 20%。
引用
@article{arxiv.2509.02464,
title = {SpecEval: Evaluating Model Adherence to Behavior Specifications},
author = {Ahmed Ahmed and Kevin Klyman and Yi Zeng and Sanmi Koyejo and Percy Liang},
journal= {arXiv preprint arXiv:2509.02464},
year = {2025}
}