2D-DPO:基于二维监督扩展直接偏好优化
计算与语言
2024-10-28 v1 人工智能
摘要
直接偏好优化(Direct Preference Optimization, DPO)的最新进展显著提升了大型语言模型(LLM)与人类偏好之间的对齐效果,得益于其简单性和有效性。然而,现有方法通常仅优化标量得分或排序奖励,忽略了人类偏好具有的多维本质。为此,本文提出将 DPO 的偏好扩展至两个维度:段落(segments)和维度(aspects)。我们首先引入一个名为 HelpSteer-2D 的二维监督数据集。对于段落维度,我们将响应划分为句子并为每个段落赋予得分。对于维度维度,我们精心设计了多个准则,涵盖响应质量的评估标准。凭借二维信号作为反馈,我们开发了一个 2D-DPO 框架,将整体目标分解为多段落目标和多维度目标。大量实验表明,2D-DPO 在流行基准测试上优于优化标量或一维偏好的方法。
关键词
引用
@article{arxiv.2410.19720,
title = {2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision},
author = {Shilong Li and Yancheng He and Hui Huang and Xingyuan Bu and Jiaheng Liu and Hangyu Guo and Weixun Wang and Jihao Gu and Wenbo Su and Bo Zheng},
journal= {arXiv preprint arXiv:2410.19720},
year = {2024}
}
备注
The first four authors contributed equally, 25 pages