中文

Verdict:扩展评判计算的库

计算与语言 2025-11-06 v2

摘要

将大语言模型作为自动评判员(LLM-as-a-judge)的做法如今已十分普遍,但标准评判器仍面临诸多可靠性问题。为此,我们提出了 Verdict——一个开源库,用于扩展评判时计算以提升自动评估器的准确性、可靠性和可解释性。Verdict利用模块化推理单元(如验证、辩论与聚合)的组合方式,以及增加的推理计算,来提高LLM评判器的质量。在诸如内容审查、事实核查和幻觉检测等多种具有挑战性的任务上,Verdict评判器的性能与数量级更大规模的微调评判器、提示式评判器和推理模型相当。我们的框架为面向研究人员和实践者的可扩展、可解释且可靠的基于LLM的评估系统奠定了基础。

关键词

引用

@article{arxiv.2502.18018,
  title  = {Verdict: A Library for Scaling Judge-Time Compute},
  author = {Nimit Kalra and Leonard Tang},
  journal= {arXiv preprint arXiv:2502.18018},
  year   = {2025}
}