大语言模型并非公平的评估者
计算与语言
2023-08-31 v2 人工智能
信息检索
摘要
本文揭示了采用大语言模型(LLMs,如 GPT-4)作为裁判对候选模型生成回复质量进行打分与比较的评估范式中的一种系统性偏差。我们发现候选回复的质量排序可轻易通过简单改变其在上下文中的出现顺序而被操纵。该操纵使我们能够扭曲评估结果,使某一模型看似明显优于另一模型,例如在以 ChatGPT 为评估者时,Vicuna-13B 可在 80 个测试查询中的 66 个上击败 ChatGPT。为解决此问题,我们提出了一个包含三种简单而有效策略的校准框架:1) 多证据校准,要求评估模型在给出评分前生成多条评估证据;2) 平衡位置校准,聚合不同顺序下的结果以确定最终分数;3) 人在回路校准,引入平衡位置多样性熵以衡量各样例的难度,并在需要时寻求人工协助。我们还在 Vicuna Benchmark 的问题提示中手动标注了 ChatGPT 与 Vicuna-13B 回复的“胜/平/负”结果,大量实验表明我们的方法成功缓解了评估偏差,使其与人类判断更为一致。我们在 \url{https://github.com/i-Eval/FairEval} 发布了代码与人工标注以促进未来研究。
引用
@article{arxiv.2305.17926,
title = {Large Language Models are not Fair Evaluators},
author = {Peiyi Wang and Lei Li and Liang Chen and Zefan Cai and Dawei Zhu and Binghuai Lin and Yunbo Cao and Qi Liu and Tianyu Liu and Zhifang Sui},
journal= {arXiv preprint arXiv:2305.17926},
year = {2023}
}