语言模型委员会:在高度主观任务上民主地基准测试基础模型
计算与语言
2025-03-20 v4 人工智能
摘要
随着大型语言模型(LLMs)的不断发展,评估它们仍然是一个持续的挑战。许多最近的评估使用LLMs作为评判者来评分其他LLMs的输出,通常依赖于像GPT-4o这样的单个大型模型。然而,使用单个LLM评判者容易出现模型内偏差,并且许多任务——例如与情商、创意写作和说服力相关的任务——可能过于主观,单个模型无法公平评判。我们引入了语言模型委员会(LMC),其中一组LLMs协作创建测试、响应测试,并以民主方式评估彼此的响应以产生排名。与之前侧重于通过使用一组较小模型来降低成本或偏差的方法不同,我们的工作考察了完全包容性LLM评估系统的优势和细微差别。在一个关于情商的详细案例研究中,我们部署了一个由20个近期LLMs组成的委员会,就人际冲突的开放式回答相互排名。我们的结果表明,LMC产生的排名更具可分离性和鲁棒性,并且通过用户研究,我们表明它们比任何单个LLM评判者更符合人类评估。然而,使用所有LLMs进行评判可能成本高昂,因此我们使用蒙特卡洛模拟和精心策划的子委员会来研究假设的委员会组成,并讨论增量LLM评判者的价值。
引用
@article{arxiv.2406.08598,
title = {Language Model Council: Democratically Benchmarking Foundation Models on Highly Subjective Tasks},
author = {Justin Zhao and Flor Miriam Plaza-del-Arco and Benjamin Genchel and Amanda Cercas Curry},
journal= {arXiv preprint arXiv:2406.08598},
year = {2025}
}