MallowsPO:利用偏好分散度微调大语言模型
机器学习
2025-04-21 v5 人工智能
机器学习
摘要
直接偏好优化(DPO)最近成为改进基于人类反馈的强化学习(RLHF)的流行方法,从而产生了更好的大语言模型(LLM)微调技术。然而,DPO的一个弱点在于其缺乏表征人类偏好多样性的能力。受Mallows偏好排序理论的启发,我们在本文中开发了一种新方法MallowsPO。该方法的一个显著特征是分散指数,它反映了人类对提示的偏好分散程度。我们证明现有的DPO模型可以简化为该分散指数的特例,从而与MallowsPO统一。更重要的是,我们(经验地)展示了如何使用该分散指数在广泛的基准任务中增强DPO的性能,从合成臂选择到可控生成和对话,同时保持强大的泛化能力。MallowsPO还与其他SOTA离线偏好优化方法兼容,当作为插件用于微调Llama3-Instruct时,额外提升了近2%的LC胜率。
引用
@article{arxiv.2405.14953,
title = {MallowsPO: Fine-Tune Your LLM with Preference Dispersions},
author = {Haoxian Chen and Hanyang Zhao and Henry Lam and David Yao and Wenpin Tang},
journal= {arXiv preprint arXiv:2405.14953},
year = {2025}
}