通过最小贝叶斯风险实现更好的指令遵循
计算与语言
2025-02-27 v4 人工智能
摘要
具备人类水平评估能力的通用大语言模型评估器不仅提供了可扩展且准确的指令遵循大语言模型评估方式,还为监督和改进其性能提供了新的途径。本文的第一部分探讨了将最小贝叶斯风险(Minimum Bayes Risk, MBR)解码作为提高指令遵循大语言模型测试时性能的方法。我们发现,使用基于参考的大语言模型评估器进行的MBR解码在AlpacaEval和MT-Bench上显著优于贪心解码、使用参考无关评估器的最佳N解码以及使用词汇和嵌入-based 指标进行的MBR解码。这些提升在参数量最高达70亿的大语言模型上均保持一致,表明可使用较小的大语言模型评估器来监督much larger的大语言模型。随后,为了在保留MBR解码改进的同时缓解额外的测试时成本,我们探索了在MBR解码输出上进行的迭代自训练。我们发现,使用直接偏好优化(Direct Preference Optimisation)进行的自训练带来了显著的性能提升,使得使用贪心解码的自训练模型通常与其基础模型使用MBR解码的性能相当,甚至在某些情况下超过。
引用
@article{arxiv.2410.02902,
title = {Better Instruction-Following Through Minimum Bayes Risk},
author = {Ian Wu and Patrick Fernandes and Amanda Bertsch and Seungone Kim and Sina Pakazad and Graham Neubig},
journal= {arXiv preprint arXiv:2410.02902},
year = {2025}
}
备注
Accepted to ICLR 2025 (Spotlight); Camera Ready