中文

群体比较推理:解锁 LLM 评判器的全面评估

计算与语言 2025-04-08 v2

摘要

LLM 评判器通过生成链式思维 (CoT) 判断而 becoming 广泛采用的自动评估方法,但其可靠性受限于 CoT 推理无法捕获全面且深入细节,常导致结果不完整。现有方法主要依赖多数投票或准则扩展,无法解决 CoT 中的局限性。我们提出群体比较评估法,通过引入额外的群体响应与候选响应进行比较,从而暴露候选响应中更深入、更全面的细节。这一过程有效引导 LLM 评判器提供更详尽的 CoT 判断。大量实验表明,我们的方法提升了评估可靠性,在五个基准测试中实现平均准确率提升 6.7%。此外,我们的方法产生更高质量的 CoT,以便 Judge 蒸馏,并在监督微调 (SFT) 的拒绝抽样中表现优异,称为群体拒绝抽样,从而实现更高效的 SFT。我们的分析确认,由我们生成的 CoT 更全面且质量更高,评估准确率随推理规模提升。

关键词

引用

@article{arxiv.2502.12501,
  title  = {Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge},
  author = {Qiyuan Zhang and Yufei Wang and Yuxin Jiang and Liangyou Li and Chuhan Wu and Yasheng Wang and Xin Jiang and Lifeng Shang and Ruiming Tang and Fuyuan Lyu and Chen Ma},
  journal= {arXiv preprint arXiv:2502.12501},
  year   = {2025}
}