中文

直接判定偏好优化

计算与语言 2025-09-15 v3

摘要

自动评估对于评估响应质量和为模型开发提供反馈至关重要。最近的研究探索了将大型语言模型 (LLM) 作为生成式评判器来评估和批评其他模型输出的方法。在本工作中, 我们 investigate 通过偏好优化从正面和负面数据中学习来增强 LLM 评判器在各种不同用例中的评估能力。我们通过三种不同方法收集用于改进我们的生成式评判器的偏好对, 每种方法旨在从不同角度提升我们的生成式评判器。我们的全面研究覆盖广泛的基准, 证明了该方法的有效性。特别是, 我们的生成式评判器在 10 个中的 13 个基准上实现了最佳性能, 超越像 GPT-4o 和专门评判模型等强大基线。进一步分析表明, 我们的评判模型能稳健地抵消内在偏见 (如位置偏见和长度偏见), 灵活适应实践者指定的任何评估协议, 并为改进下游生成模型提供有帮助的语言反馈。

关键词

引用

@article{arxiv.2409.14664,
  title  = {Direct Judgement Preference Optimization},
  author = {Peifeng Wang and Austin Xu and Yilun Zhou and Caiming Xiong and Shafiq Joty},
  journal= {arXiv preprint arXiv:2409.14664},
  year   = {2025}
}

备注

EMNLP 2025