中文

假设引导的自然语言生成评估:HypoEval

计算与语言 2025-04-11 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 已展示出在自动化自然语言生成评估方面的巨大潜力。以往的 LLM 作为评判官的框架存在两个不足:要么采用零样本设置而不咨询任何人类输入,导致对齐度低;要么在标记数据上微调,需要大量样本。此外,先前方法往往对自动化评估提供的推理极少。在本文中,我们提出了 HypoEval,即假设引导的评估框架,该框架首先使用小型人类评估语料库生成更详细的人类判断 rubric,然后采用类似检查表的方式,将 LLM 在每个分解维度上分配的分数组合以获得总体分数。仅需 30 个人类评估,HypoEval 在与人类排名 (Spearman 相关系数) 和人类分数 (Pearson 相关系数) 的对齐度方面达到了最新水平,平均超过 G-Eval 提高了 11.86%,并在至少需要 3 倍以上人类评估的情况下的微调 Llama-3.1-8B-Instruct 上提升了 11.95%。此外,我们进行了系统性研究来评估 HypoEval 的鲁棒性,凸显其作为可靠且可解释的自动化评估框架的有效性。

关键词

引用

@article{arxiv.2504.07174,
  title  = {HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation},
  author = {Mingxuan Li and Hanchen Li and Chenhao Tan},
  journal= {arXiv preprint arXiv:2504.07174},
  year   = {2025}
}

备注

22 pages, 3 figures, code link: https://github.com/ChicagoHAI/HypoEval-Gen