Verdict:扩展评判计算的库
计算与语言
2025-11-06 v2
摘要
将大语言模型作为自动评判员(LLM-as-a-judge)的做法如今已十分普遍,但标准评判器仍面临诸多可靠性问题。为此,我们提出了 Verdict——一个开源库,用于扩展评判时计算以提升自动评估器的准确性、可靠性和可解释性。Verdict利用模块化推理单元(如验证、辩论与聚合)的组合方式,以及增加的推理计算,来提高LLM评判器的质量。在诸如内容审查、事实核查和幻觉检测等多种具有挑战性的任务上,Verdict评判器的性能与数量级更大规模的微调评判器、提示式评判器和推理模型相当。我们的框架为面向研究人员和实践者的可扩展、可解释且可靠的基于LLM的评估系统奠定了基础。
引用
@article{arxiv.2502.18018,
title = {Verdict: A Library for Scaling Judge-Time Compute},
author = {Nimit Kalra and Leonard Tang},
journal= {arXiv preprint arXiv:2502.18018},
year = {2025}
}