中文

从计算到裁决:检视数学推理任务上的大语言模型裁判

计算与语言 2025-05-14 v2 人工智能

摘要

为减少对人类标注的需求,大语言模型(LLM)被提出作为其他候选模型质量的裁判。 LLM 裁判的性能通常通过衡量其在摘要或机器翻译等生成式任务上与人类判断相关性来评估。相反,我们研究 LLM 裁判在数学推理任务上的表现。这些任务需要多步骤推理,且其解的正确性可被验证,从而实现更客观的评估。我们进行了详细的绩效分析,发现容易的样本容易被裁判,困难的样本难以被裁判。我们的分析揭示了裁判绩效与候选模型任务绩效之间存在强相关性,这表明裁判倾向于偏好即使答案错误但整体质量更高的模型。因此,我们测试了是否可以使用诸如词性标签等简单特征来预测 LLM 裁判的行为,并发现可正确预测 70%~75% 的裁决结果。我们通过分析实际应用场景,表明 LLM 裁判在一致地检测平均质量更好的模型方面有效,但若用于提升任务性能则大多失败。

关键词

引用

@article{arxiv.2409.04168,
  title  = {From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks},
  author = {Andreas Stephan and Dawei Zhu and Matthias Aßenmacher and Xiaoyu Shen and Benjamin Roth},
  journal= {arXiv preprint arXiv:2409.04168},
  year   = {2025}
}