中文

解构人类对 LLM 的偏好:基于 HUMAINE 框架的人口统计感知评估

计算与语言 2026-03-06 v1 人工智能 人机交互

摘要

大语言模型的评估面临诸多挑战。技术基准测试往往缺乏现实关联性,而现有人类偏好评估又受样本代表性不足、评估深度浅薄以及单指标简化等问题困扰。为此,本文引入 HUMAINE 框架,实现对人类-人工智能互动的多维度、人口统计感知测量。我们收集了来自 23404 名来自美国和英国的参与者,按 22 个人口统计学群体进行分层抽样,以评估 28 个最先进模型在五个以人类为中心的维度上的表现。我们采用层次贝叶斯 Bradley-Terry-Davidson(BTD)模型,并进行后验加权以匹配人口普查数据。分析结果揭示了三个关键发现。\textbf{(1)} 我们确立了明确的性能层级,其中 \texttt{google/gemini-2.5-pro} 以 95.6% 的后验概率位居第一。\textbf{(2)} 我们发现偏好存在显著差异,用户年龄成为主要的人口统计学维度;模型的感知排名在不同年龄群体间会发生显著变化,这暴露了在样本代表性不足时常被掩盖的泛化失效。\textbf{(3)} 我们量化了不同评估维度之间的判别力差异,模糊属性(如 \textit{Trust, Ethics \& Safety})的挂腰率高达 65%,而 \textit{Overall Winner} 仅为 10%。本工作强调在 LLM 评估中需要更加多维度和人口统计感知的视角。我们公开了完整数据集、交互式排行榜以及开源框架。

关键词

引用

@article{arxiv.2603.04409,
  title  = {Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework},
  author = {Nora Petrova and Andrew Gordon and Enzo Blindow},
  journal= {arXiv preprint arXiv:2603.04409},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV