是时候质疑LLM-as-a-Judge了:程序化评估是未来的方向
机器学习
2025-06-13 v1 人工智能
摘要
大语言模型(LLMs)被广泛用于评估LLM生成内容的质量,但这带来了显著挑战:高昂的API成本、不可靠的灵活性、僵化的流水线以及固有的偏差。为解决这些问题,我们提出了PAJAMA(Program-As-a-Judge for Automated Model Assessment,程序即自动模型评估裁判),这是一种新方法,利用LLMs合成可执行的评判程序而非直接对回答进行评分。这些合成的程序可以存储并在本地运行,成本降低数个数量级,同时提供可解释且可审计的评判逻辑,易于适配。基于程序的裁判缓解了偏差,与基于Qwen2.5-14B的LLM-as-a-judge相比,将评判一致性提高了15.83%,平均减少23.7%的偏差回答。当程序评判被蒸馏为模型时,PAJAMA在具有挑战性的RewardBench的CHAT-HARD子集上超越了LLM-as-a-judge,在Prometheus指标上超越2.19%,在JudgeLM数据集上超越8.67%,且成本降低了三个数量级。
引用
@article{arxiv.2506.10403,
title = {Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation},
author = {Tzu-Heng Huang and Harit Vishwakarma and Frederic Sala},
journal= {arXiv preprint arXiv:2506.10403},
year = {2025}
}