深入考察基于大语言模型的自动评测
计算与语言
2023-10-10 v1
摘要
使用大语言模型(LLMs)评估文本质量近来颇受欢迎。一些先前的工作探索了使用 LLM 进行评测的思路,但它们在评测过程的一些细节上有所不同。在本文中,我们分析了 LLM 评测(Chiang and Lee, 2023)与 G-Eval(Liu et al., 2023),并讨论了评测过程中的这些细节如何改变 LLM 给出的评分与人类评分的相关性。我们发现 G-Eval 中使用的自动思维链(CoT)并不总能使 G-Eval 更贴合人类评分。我们还表明,如 G-Eval 那样强制 LLM 仅输出数值评分是次优的。最后,我们揭示让 LLM 解释其自身评分能够持续提升 ChatGPT 与人类评分之间的相关性,并在两个元评测数据集上推进了最先进(SoTA)相关性。
引用
@article{arxiv.2310.05657,
title = {A Closer Look into Automatic Evaluation Using Large Language Models},
author = {Cheng-Han Chiang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2310.05657},
year = {2023}
}
备注
EMNLP 2023 findings (short paper). Code: https://github.com/d223302/A-Closer-Look-To-LLM-Evaluation/