G-Eval:使用GPT-4且具更佳人类一致性的NLG评估方法
计算与语言
2023-05-25 v3 人工智能
摘要
自然语言生成(NLG)系统生成文本的质量难以自动度量。传统的基于参考的指标,如BLEU和ROUGE,已被证明与人类判断的相关性较低,尤其对于需要创造性和多样性的任务。近期研究建议使用大语言模型(LLM)作为无参考的NLG评估指标,其优势在于可应用于缺乏人类参考的新任务。然而,这些基于LLM的评估器仍比中等规模神经评估器具有更低的人类一致性。本文中,我们提出G-Eval,一种使用具有思维链(CoT)和表单填充范式的大语言模型来评估NLG输出质量的框架。我们在文本摘要和对话生成两个生成任务上实验。结果表明,以GPT-4为骨干模型的G-Eval在摘要任务上与人类达到0.514的Spearman相关性,大幅优于以往所有方法。我们还对基于LLM的评估器行为进行了初步分析,并强调了此类评估器可能对LLM生成文本存在偏倚的潜在问题。代码见https://github.com/nlpyang/geval
引用
@article{arxiv.2303.16634,
title = {G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment},
author = {Yang Liu and Dan Iter and Yichong Xu and Shuohang Wang and Ruochen Xu and Chenguang Zhu},
journal= {arXiv preprint arXiv:2303.16634},
year = {2023}
}