EigenBench:价值对齐的比较行为度量
人工智能
2026-03-03 v4 计算与语言
计算机与社会
机器学习
摘要
与人类价值观保持对齐是当前尚未解决的难题。为解决缺乏价值对齐定量指标的问题,我们提出了 EigenBench:一种用于比较衡量语言模型价值观的黑盒方法。给定一组模型、描述价值体系的宪法以及情景数据集,我们的方法返回一组分数,量化每个模型与给定宪法的对齐程度。要产生这些分数,每个模型在众多情景下对其他模型的输出进行判断,并通过 EigenTrust (Kamvar 等,2003) 聚合这些判断,产生反映整个 ensemble 加权共识判断的分数。EigenBench 不使用ground truth标签,因为其设计旨在量化那些合理的判断者可能对正确标签有不同看法的主观特征。因此,我们为验证该方法,收集了对同一 ensemble 中的模型的人类判断,并表明 EigenBench 的判断与人类评估者的判断高度一致。我们进一步展示了 EigenBench 能否在没有客观标签的情况下恢复 GPQA 基准上的模型排名,支持其作为评估没有 ground truth 的主观价值的框架。代码地址为 https://github.com/jchang153/EigenBench。
关键词
引用
@article{arxiv.2509.01938,
title = {EigenBench: A Comparative Behavioral Measure of Value Alignment},
author = {Jonathn Chang and Leonhard Piff and Suvadip Sana and Jasmine X. Li and Lionel Levine},
journal= {arXiv preprint arXiv:2509.01938},
year = {2026}
}