中文

面向基础模型的人类中心评估

计算与语言 2025-06-03 v1

摘要

目前,几乎所有对基础模型的评估都侧重于客观指标,强调通过问答表现来定义模型能力。尽管这种以模型为中心的方法能够实现快速的性能评估,但它无法反映真实的人类体验。为了弥补这一不足,我们提出了一种以人类为中心的主观评估(HCE)框架,聚焦于三个核心维度:问题解决能力、信息质量和交互体验。通过涉及 Deepseek R1、OpenAI o3 mini、Grok 3 和 Gemini 2.5 的实验,我们开展了超过 540 次由参与者驱动的评估,人类与模型在开放式研究任务中协作,从而生成了一个全面的主观数据集。该数据集捕捉了跨多个学科的不同用户反馈,揭示了各模型独特的优势与适应性。我们的研究结果表明,Grok 3 表现最佳,其次是 Deepseek R1 和 Gemini 2.5,OpenAI o3 mini 表现落后。通过提供新颖的框架和丰富的数据集,本研究不仅完善了主观评估方法,也为标准化、自动化评估奠定了基础,从而推动了面向研究与实际场景的 LLM 的发展。我们的数据集链接为 https://github.com/yijinguo/Human-Centric-Evaluation。

关键词

引用

@article{arxiv.2506.01793,
  title  = {Human-Centric Evaluation for Foundation Models},
  author = {Yijin Guo and Kaiyuan Ji and Xiaorong Zhu and Junying Wang and Farong Wen and Chunyi Li and Zicheng Zhang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2506.01793},
  year   = {2025}
}