中文

基于自适应偏好学习与最优传输的鲁棒奖励建模——APLOT

机器学习 2025-10-14 v1 人工智能

摘要

奖励模型 (RM) 在通过强化学习将大语言模型 (LLM) 对齐人类偏好方面起关键作用,其中布拉德利-蒂尔 (BT) 目标被认可为简单却强大,特别适用于两两偏好学习。然而,基于 BT 的 RM 常难以有效区分相似的偏好响应,导致优选与非优选输出之间的分离不足,易过拟合容易样本,难以在分布外 (OOD) 样本上泛化,表现次佳。为此,本文通过自适应边际机制增强 BT 基于 RM 的方法。具体设计,基于语义相似度和模型预测奖励差异,动态调整 RM 对更具挑战性样本的关注度,从分布角度切入,可通过最优传输 (OT) 求解。将这些因素纳入原则性 OT 成本矩阵设计中,自适应边际使 RM 能更好地捕捉优选与被拒绝响应之间的分布差异,显著提升性能、收敛速度和泛化能力。多项基准实验表明,我们的方法优于多种现有 RM 技术,在内部分布 (ID) 和 OOD 场景中均实现性能提升。此外,RLHF 实验支持我们在更好地将 LLM 对齐人类偏好方面的实际有效性。代码已公开于 https://github.com/BIRlz/APLOT。

关键词

引用

@article{arxiv.2510.10963,
  title  = {APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport},
  author = {Zhuo Li and Yuege Feng and Dandan Guo and Jinpeng Hu and Anningzhe Gao and Xiang Wan},
  journal= {arXiv preprint arXiv:2510.10963},
  year   = {2025}
}

备注

EMNLP2025