中文

检验模型规格揭示语言模型间的字符差异

计算与语言 2025-10-24 v2 人工智能

摘要

大型语言模型 (LLM) 正在从AI宪法和模型规格中进行训练,这些规格建立了行为准则和伦理原则的框架。然而,这些规格面临着严重挑战,包括原则之间的内部冲突以及对细腻情景的覆盖不足。我们提出了一套系统化的方法,用于检验模型规格字符,自动识别当前模型规格中大量原则矛盾和解释性歧义的案例。我们通过生成强制在竞争价值原则之间做出明确权衡的情景来进行压力测试。使用全面的分类法,我们生成多样化的价值权衡情景,使得模型必须在无法同时满足的两对合法原则之间进行选择。我们评估了来自Anthropic、OpenAI、Google、xAI等主要供应商的12个前沿LLM的响应,并通过价值分类得分衡量行为差异。在这些情景中,我们发现超过70,000个案例显示出显著的行为分歧。经验上,我们发现这种模型行为在规格中的高差异强烈预测模型规格潜在问题。通过定性分析,我们提供了诸多示例性问题,包括当前模型规格中的直接矛盾和原则解释性歧义。此外,我们生成的数据集还揭示了所有前沿模型中都存在的明显误差和误报情况。最后,我们还提供了这些模型的价值优先级模式和差异。

关键词

引用

@article{arxiv.2510.07686,
  title  = {Stress-Testing Model Specs Reveals Character Differences among Language Models},
  author = {Jifan Zhang and Henry Sleight and Andi Peng and John Schulman and Esin Durmus},
  journal= {arXiv preprint arXiv:2510.07686},
  year   = {2025}
}