中文

评估 LLM 中的 AI 对齐:基于输出分析的 75 个模型价值优先级与人类基准测试

人工智能 2026-05-19 v4 人机交互

摘要

大语言模型(LLM)在人机交互研究和实践中被越来越多地使用,但现有的能力和安全基准测试很少揭示这些系统所表达的价值优先级,以及这些优先级如何与人类判断相对应。在三项研究中,我们引入了一种基于输出的方法来评估 AI 对齐的一个方面,即将 LLM 生成的文本作为行为数据,并将其表达的价值优先级特征与人类参考进行比较。研究 1 使用归纳定性分析推导出最优 AI 运行的六个主题,即性能、适应能力、社会公益、伦理与责任、关系整合和能动性。研究 2 表明 LLM 输出在模型内部高度稳定,并在模型之间收敛于一个共同的价值优先级结构,表明价值特征具有可靠性和可比性。研究 3 使用一个特征保真度指标对 75 个当代 LLM 与 376 名人类受访者进行了基准测试,该指标同时捕捉优先级的相对排序和优先级之间差异的校准程度。尽管大多数模型再现了人类的价值排序,但一些模型系统性地夸大了它们之间的差异,这表明模型在传统基准测试上可能看起来对齐,但在价值校准上仍与人类存在偏差。特征保真度在不同模型间差异显著,且与模型规模、新近性或能力等级并不一致收敛。LLM 和人类都倾向于降低能动性的优先级,这对开发日益具有能动性的 AI 系统提出了重要问题。对于研究和实际应用,这六个主题和基于特征的指标提供了一种可扩展的方法,用于在部署前审计 LLM 的价值特征。

关键词

引用

@article{arxiv.2506.12617,
  title  = {Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking},
  author = {Gabriel Rongyang Lau and Wei Yan Low and Seow Min Koh and Fiona Fui-Hoon Nah and Andree Hartanto},
  journal= {arXiv preprint arXiv:2506.12617},
  year   = {2026}
}