中文

基于最大差异竞争的大语言模型样本高效人类评估

机器学习 2025-05-30 v2 计算与语言 人机交互

摘要

大语言模型(LLM)的可靠评估受到两个关键挑战的阻碍:客观指标往往无法反映人类对自然语言的感知,而详尽的人工标注成本过高。在此,我们提出了一种基于最大差异(MAD)竞争原则的 LLM 样本高效人类评估方法。我们的方法自动且自适应地选择一组紧凑的输入指令,以最大化 LLM 响应对之间的语义差异。人类评估者随后对这些配对响应进行三选一强迫选择,并使用 Elo 评分将其聚合为全局排名。我们应用该方法在四个任务上比较了八种广泛使用的 LLM:科学知识理解、数学推理、创意与功能性写作,以及代码生成与解释。实验结果表明,我们的样本高效评估方法能够利用少量 MAD 选取的指令恢复“黄金标准”模型排名,揭示每个 LLM 各自的优势与劣势,并为指导未来 LLM 的开发提供细致的见解。代码可在 https://github.com/weiji-Feng/MAD-Eval 获取。

关键词

引用

@article{arxiv.2404.08008,
  title  = {Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition},
  author = {Kehua Feng and Keyan Ding and Hongzhi Tan and Kede Ma and Zhihua Wang and Shuangquan Guo and Yuzhou Cheng and Ge Sun and Guozhou Zheng and Qiang Zhang and Huajun Chen},
  journal= {arXiv preprint arXiv:2404.08008},
  year   = {2025}
}

备注

35 pages, 6 figures, Accepted by ACL 2025