大型语言模型评估:通过迭代两两比较的击掷制
计算与语言
2025-07-10 v3 人工智能
摘要
大型语言模型(LLM)已显示在诸多领域如机器翻译或科学领域中作为评估者具有有效性。当前的 LLM-作为-裁判方法主要依赖单一评估或单轮两两评估,阻止了裁判 LLM 获得全局排名视角。为此,我们提出击掷制评估(Knockout Assessment),一种使用击掊锦标赛系统进行迭代两两比较的 LLM-作为-裁判方法。实验在三种 LLM 上进行,对两个数据集显示,击掷制评估在评分准确度方面取得改进,大学水平考试评分和机器翻译评估的皮尔逊相关系数平均提升 0.07,使 LLM 评估更贴近人类评分。
引用
@article{arxiv.2506.03785,
title = {Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons},
author = {Isik Baran Sandan and Tu Anh Dinh and Jan Niehues},
journal= {arXiv preprint arXiv:2506.03785},
year = {2025}
}
备注
Accepted to GEM @ ACL 2025