中文

论面向 LLM 评判器的成本效益改进技术

计算与语言 2026-05-04 v2

摘要

使用语言模型对候选响应进行评分或排序,已成为强化学习来自人类反馈(RLHF)管道、基准测试和应用层评估中可扩展的人类评估替代方案。然而,输出的可靠性高度依赖提示策略和聚合方法。我们present对四种即插即用技术——ensemble scoring(ensemble 评分)、task-specific criteria injection(任务特定准则注入)、calibration context(校准上下文)和 adaptive model escalation(自适应模型升级)——在RewardBench 2上提升 LLM 评判器准确性的实证研究,统一从对随机评判器噪声控制的角度进行分析:ensemble 评分作为每次调用噪声的蒙特卡洛平均,准则注入作为响应间判别 sharpen,单次响应得分方差作为不确定性信号。ensemble 评分与任务特定准则注入(后者几乎不增加成本)联合可达到最高85.8%的准确率,较基线提升13.5个百分点。校准上下文和自适应模型升级也均超过基线,但在成本-准确性帕累托前沿上受限于准则+ensemble 方法。小模型从ensemble 中受益最大,使高精度 LLM 评判器在低成本下也能实现。我们展示了这些技术在不同模型提供商处都具有普适性,在OpenAI GPT 和 Anthropic Claude 系列模型上进行了验证。

关键词

引用

@article{arxiv.2604.13717,
  title  = {On Cost-Effective LLM-as-a-Judge Improvement Techniques},
  author = {Ryan Lail and Luke Markham},
  journal= {arXiv preprint arXiv:2604.13717},
  year   = {2026}
}

备注

13 pages, 9 figures