用MT-Bench和Chatbot Arena评判LLM-as-a-Judge
计算与语言
2023-12-27 v4 人工智能
摘要
评估基于大语言模型(LLM)的聊天助手具有挑战性,因其能力广泛且现有基准不足以衡量人类偏好。为此,我们探索使用强LLM作为评判者,在更开放性的问题上来评估这些模型。我们考察了LLM-as-a-judge的使用与局限,包括位置、冗长与自我增强偏差,以及有限的推理能力,并提出了缓解其中部分问题的方法。随后我们通过引入两个基准来验证LLM评判者与人类偏好间的一致性:MT-bench,一个多轮问题集;以及Chatbot Arena,一个众包对战平台。我们的结果显示,诸如GPT-4之类的强LLM评判者能很好地匹配受控与众包的人类偏好,达到超过80%的一致率,即人类之间的一致水平。因此,LLM-as-a-judge是一种可扩展且可解释的近似人类偏好之方法,而人类偏好原本极难获取。此外,我们通过评估LLaMA与Vicuna的数个变体,表明我们的基准与传统基准互为补充。MT-bench问题、3K专家投票以及带人类偏好的30K对话已公开于https://github.com/lm-sys/FastChat/tree/main/fastchat/llm_judge。
引用
@article{arxiv.2306.05685,
title = {Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena},
author = {Lianmin Zheng and Wei-Lin Chiang and Ying Sheng and Siyuan Zhuang and Zhanghao Wu and Yonghao Zhuang and Zi Lin and Zhuohan Li and Dacheng Li and Eric P. Xing and Hao Zhang and Joseph E. Gonzalez and Ion Stoica},
journal= {arXiv preprint arXiv:2306.05685},
year = {2023}
}
备注
NeurIPS 2023 Datasets and Benchmarks Track