中文

大型语言模型评估:通过迭代两两比较的击掷制

计算与语言 2025-07-10 v3 人工智能

摘要

大型语言模型(LLM)已显示在诸多领域如机器翻译或科学领域中作为评估者具有有效性。当前的 LLM-作为-裁判方法主要依赖单一评估或单轮两两评估,阻止了裁判 LLM 获得全局排名视角。为此,我们提出击掷制评估(Knockout Assessment),一种使用击掊锦标赛系统进行迭代两两比较的 LLM-作为-裁判方法。实验在三种 LLM 上进行,对两个数据集显示,击掷制评估在评分准确度方面取得改进,大学水平考试评分和机器翻译评估的皮尔逊相关系数平均提升 0.07,使 LLM 评估更贴近人类评分。

关键词

引用

@article{arxiv.2506.03785,
  title  = {Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons},
  author = {Isik Baran Sandan and Tu Anh Dinh and Jan Niehues},
  journal= {arXiv preprint arXiv:2506.03785},
  year   = {2025}
}

备注

Accepted to GEM @ ACL 2025