中文

训练 LLM 评判模型:管道、洞见与实践经验

计算与语言 2025-02-06 v1 人工智能 机器学习

摘要

大型语言模型(LLM)的快速发展为其作为评估性评判器的应用开辟了新可能性。本文介绍了 Themis——一个经过微调的 LLM 评判器,能够提供精细的情境感知评估。我们提供了 Themis 开发管道的全面概述,强调其场景依赖性评估提示以及两种新颖的受控指令生成方法。这些设计使 Themis 能够有效地从教师模型中提炼评估技能,同时保持持续开发的灵活性。我们引入了两个人类标注的基准用于元评估,证明 Themis 能够以经济方式实现与人类偏好高度一致。此外,我们探讨了 LLM 作为评判器范式的洞见,揭示了性能与参考答案不同影响的细微差别。值得注意的是,我们观察到从强 LLM 进行纯知识蒸馏虽为常见做法,但通过规模化并不必然保证性能提升。我们提出了基于指令跟随难度的缓解策略。进一步,我们提供实践指南,涵盖数据平衡、提示词定制、多目标训练与指标聚合。我们希望本方法与发现结果,以及微调数据、基准与模型检查点,能支持该领域未来的研究与开发。

关键词

引用

@article{arxiv.2502.02988,
  title  = {Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons},
  author = {Renjun Hu and Yi Cheng and Libin Meng and Jiaxin Xia and Yi Zong and Xing Shi and Wei Lin},
  journal= {arXiv preprint arXiv:2502.02988},
  year   = {2025}
}

备注

accepted at WWW'25 (Industrial Track), extended version