形式胜于实质:大语言模型的评估偏差
计算与语言
2023-11-14 v3
摘要
随着大语言模型(LLMs)持续发展,准确而全面地评估其性能变得愈发困难。基于人类判断、依据Elo评分对LLM相对性能进行排序正日益流行。然而,人类和LLM作为评估者的能力究竟如何仍不确定。本研究考察了众包标注者、专家标注者以及LLM在比较不同模型输出时的行为。为此,我们策划了一个包含故意出错机器生成答案的数据集。我们的发现揭示了评估过程中令人担忧的偏差:含有事实错误的答案比过短或含语法错误的答案获得更有利的评分。为解决此问题,我们建议对机器生成文本进行多维度独立评估,而非将所有评估方面合并为单一分数。我们用Elo评分系统实现了该思路,得到了多Elo评分系统(MERS)。本研究的实证结果表明,该提出的方法显著提升了基于LLM的评估质量,尤其在事实准确性方面。然而,基于众包标注的评估无显著改善,表明尚需进一步研究。
引用
@article{arxiv.2307.03025,
title = {Style Over Substance: Evaluation Biases for Large Language Models},
author = {Minghao Wu and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2307.03025},
year = {2023}
}
备注
Work in progress, 15 pages, 5 tables, 12 figures