中文

MixDPO:用于多元对齐的偏好强度建模

机器学习 2026-01-13 v1 人工智能 计算与语言

摘要

基于偏好的对齐目标隐含假设所有人类偏好表达的强度相等。实际情况下,偏好强度在不同个体和情境之间存在差异——这一现象在行为经济学和离散选择理论中已被确立。这一差异限制了现有目标真实捕捉异构人类判断的能力。鼓舞人心的是,受此文献启发,我们引入混合逻辑直接偏好优化(MixDPO),即Direct Preference Optimization 的一种泛化,其建模偏好强度的差异。MixDPO 使对齐目标能够捕捉训练示例中偏好表达强度的异构性。我们在三个偏好数据集上评估了 MixDPO,使用两个开源语言模型。跨数据集,MixDPO 在整体对齐性能上提升了 11.2 分(以 Pythia-2.8B 为例),同时保持了子群层面的偏好,提升幅度最大出现在推断偏好异构性较高的情境。MixDPO 通过学习的强度分布使偏好异构性显式化。我们发布了代码以便复现。

关键词

引用

@article{arxiv.2601.06180,
  title  = {MixDPO: Modeling Preference Strength for Pluralistic Alignment},
  author = {Saki Imai and Pedram Heydari and Anthony Sicilia and Asteria Kaeberlein and Katherine Atwell and Malihe Alikhani},
  journal= {arXiv preprint arXiv:2601.06180},
  year   = {2026}
}