基于Sharpe比率引导的强化学习人类反馈中的主动学习偏好优化
人工智能
2025-03-31 v1 机器学习
摘要
从人类反馈中进行强化学习(RLHF)已成为大型语言模型(LLM)训练和对齐管道的基石。近期进展,例如直接偏好优化(DPO),已简化了偏好学习步骤。然而,收集偏好数据仍是一个具有挑战性和高成本的过程,常需专家标注。这种成本可以通过仔细选择呈现供标注的数据点来缓解。在本工作中,我们提出了一种基于Sharpe比率的风险评估策略的主动学习方法,用于高效选择提示和偏好对。为了解决在标注前偏好未知的挑战,我们的方法评估所有潜在偏好标注的梯度,以评估其对模型更新的影响。这些基于梯度的评估使我们能够对数据点进行风险评估,而无论标注结果如何。通过利用DPO损失推导,我们推导出在每个元组上计算这些Sharpe比率的闭式表达式,确保我们的方法既可实现又具计算效率。我们还引入了本方法的两种变体,每种变体对先前信息作出不同的假设。实验结果表明,在多种语言模型和真实数据集上,我们的方法在有限的人类偏好数据下,以最高可达5%的优势击败基线。
引用
@article{arxiv.2503.22137,
title = {Sharpe Ratio-Guided Active Learning for Preference Optimization in RLHF},
author = {Syrine Belakaria and Joshua Kazdan and Charles Marx and Chris Cundy and Willie Neiswanger and Sanmi Koyejo and Barbara E. Engelhardt and Stefano Ermon},
journal= {arXiv preprint arXiv:2503.22137},
year = {2025}
}