RankJudge:多轮LLM评判器综合基准生成器
计算与语言
2026-05-22 v1
摘要
随着交互式LLM应用被创建和细化,模型开发者需要沿多个维度评估生成文本的质量。对于较简单的系统,人工评估可能是可行的,但在复杂的对话聊天机器人等系统中,生成的文本量可能压倒人工标注资源。模型开发者开始大量依赖自动评估,其中LLMs也被用于评判生成质量。然而,现有的LLM评判器基准大多聚焦于不匹配多轮对话复杂度的简单问答任务。我们介绍RankJudge,这是一个用于评估LLM评判器在基于参考文档的多轮对话中表现的基准生成器。RankJudge创建一对对话,其中一对对话在一个轮次中注入单个缺陷。这种构建方式允许对话对被明确地标记为更好或更差,并且将失效类别严格局限于单个轮次,从而为评判提供严格的联合正确性标准。我们在机器学习、生物医学和金融等领域实现了RankJudge,评估了21个前沿LLM评判器,并通过Bradley-Terry模型对这些评判器进行排名。我们的表述还允许对每个对话对进行难度评级,我们利用这一点动态精选评估切片以减少标签噪声,人工标注已证实这一点。我们发现评判器在部分可见性、较粗糙的正确性标准以及另一种随机漫步评级算法下排名稳定。
引用
@article{arxiv.2605.21748,
title = {RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator},
author = {Zhenwei Tang and Zhaoyan Liu and Rasa Hosseinzadeh and Tongzi Wu and Keyvan Golestan and Jesse C. Cresswell},
journal= {arXiv preprint arXiv:2605.21748},
year = {2026}
}