中文

深层价值基准:衡量模型是学习深层价值还是浅层偏好

人工智能 2026-01-13 v3 计算与语言 计算机与社会

摘要

我们引入了深层价值基准(Deep Value Benchmark, DVB),用于直接测试大型语言模型(LLM)是否学习基本的人类价值,还是仅仅捕捉表面级的偏好。这一区别对于AI对齐至关重要:捕捉更深层价值的系统更可能稳健地泛化人类意图,而仅捕捉偏好数据中表面模式的系统则风险产生不对齐行为。DVB采用一种新颖的实验设计,通过控制深层价值(例如,道德原则)与浅层特征(例如,表层属性)之间的潜在相关性。在训练阶段,我们让LLM面对人类偏好数据,其中深层和浅层特征被刻意地相关——例如,用户一致偏好(非恶意,正式语言)选项而不是(正义,非正式语言)备选方案。在测试阶段,我们打破这些相关性,呈现(正义,正式语言)与(非恶意,非正式语言)选项之间的选择。这一设计允许我们精确测量模型的深层价值泛化率(Deep Value Generalization Rate, DVGR)——即基于底层价值而非浅层特征进行泛化的概率。在9个模型中,平均DVGR仅为0.30。所有模型的深层价值泛化都低于随机水平。较大的模型在DVGR上(稍差)于较小的模型。我们正在发布数据集,该数据集经过三次独立的人类验证实验。DVB为对齐核心特征提供了一个可解释的衡量标准。

关键词

引用

@article{arxiv.2511.02109,
  title  = {Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences},
  author = {Joshua Ashkinaze and Hua Shen and Saipranav Avula and Eric Gilbert and Ceren Budak},
  journal= {arXiv preprint arXiv:2511.02109},
  year   = {2026}
}

备注

NeurIPS 2025 (Spotlight)