中文

微调LLM评判器的生命周期:面向未来保障、向后兼容性与问题泛化

计算与语言 2026-04-21 v2 人工智能 机器学习

摘要

LLM-as-a-judge范式广泛用于评估自由文本模型响应以及模型对齐和微调中的奖励建模。最近,利用特定评判数据微调评判器已成为比直接提示前沿模型作为评判器更受青睐的选择,因为前者以更小的模型规模实现了更好的性能,同时对常见偏差更具鲁棒性。然而,标准评估忽略了这些微调评判器在真实部署中的若干实际问题。在本文中,我们识别并形式化了影响这些评判器生命周期的三个方面:面向未来保障与向后兼容性——在今日生成模型响应上微调的评判器在未来模型或过去模型响应上的表现如何,以及问题泛化——评判器在测试时对未见问题的泛化能力如何。我们在统一框架下研究这三个方面,涉及不同的训练与测试分布、两种推理数据集、三种基于SFT和DPO的微调算法以及三种不同骨干模型。实验表明,面向未来保障对大多数模型而言具有挑战性,而向后兼容性相对容易,DPO训练的模型持续提升性能。我们进一步发现,持续学习比仅针对更强或更弱响应进行训练提供了更均衡的适应性,以应对新旧响应分布之间的变化。此外,所有模型在从训练阶段见到的问题迁移到未见问题时都表现出一定程度的性能下降,表明当前评判器尚未完全泛化到未见问题。这些发现为在不断变化的生成器面前开发和部署评判模型提供了实用见解。

关键词

引用

@article{arxiv.2509.23542,
  title  = {On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization},
  author = {Janvijay Singh and Austin Xu and Yilun Zhou and Yefan Zhou and Dilek Hakkani-Tur and Shafiq Joty},
  journal= {arXiv preprint arXiv:2509.23542},
  year   = {2026}
}

备注

Updated after ICLR 2026 Acceptance; 29 pages;