DHP基准测试:大语言模型是否是优秀的自然语言生成评估器?
计算与语言
2025-02-26 v2 人工智能
摘要
大型语言模型(LLM)日益增加地作为自然语言生成(NLG)任务的评估器;这常被称为“LLM-as-a-judge”范式。然而,LLM在评估NLG质量方面的能力仍未得到充分探索。当前研究依赖人类评估和简单度量标准,无法捕捉LLM在多样化NLG任务中的判断能力。为此,我们提出了判别分层扰动(DHP)基准框架,该框架为LLM提供定量判别得分。该框架利用层次化扰动文本数据和统计检验,系统性地衡量LLM的NLG评估能力。我们重新构建了六个评估数据集,涵盖四个NLG任务:摘要生成、故事续写、问答和翻译。我们对五大主要LLM家族进行全面基准测试,为理解其作为NLG评估器的优势与局限提供了关键见解。我们的数据集可在 https://huggingface.co/datasets/YCWANGVINCE/DHP_Benchmark 获取。
引用
@article{arxiv.2408.13704,
title = {DHP Benchmark: Are LLMs Good NLG Evaluators?},
author = {Yicheng Wang and Jiayi Yuan and Yu-Neng Chuang and Zhuoer Wang and Yingchi Liu and Mark Cusick and Param Kulkarni and Zhengping Ji and Yasser Ibrahim and Xia Hu},
journal= {arXiv preprint arXiv:2408.13704},
year = {2025}
}