中文

RLHF与对比学习之间的隐藏联系

机器学习 2025-10-14 v2 人工智能 机器学习

摘要

大型语言模型(LLM)与人类价值观的对齐最近受到广泛关注,典型且成本高昂的案例包括强化学习从人类反馈(RLHF)以及简单直接偏好优化(DPO)。本文证明,RLHF与DPO可从相互信息(MI)最大化的视角进行解释,揭示了与对比学习的深刻联系。在此框架下,RLHF与DPO可解释为基于来自基础模型的正负样本进行对比学习的方法,利用Donsker-Varadhan(DV)下界估计MI(等价于MINE估计器)。这种范式进一步阐明了为何RLHF可能无法内在地激励LLM超越基础模型所已具备的推理能力。基于此视角,我们用Jensen-Shannon(JS)MI估计器取代DV/MINE下界,提出了相互信息优化(MIO)。综合的理论分析和广泛的实证评估表明,MIO缓解了DPO在后期阶段所见选择概率下降的问题,在各种具有挑战性的推理和数学基准测试中实现了竞争甚至更好的性能。

关键词

引用

@article{arxiv.2506.22578,
  title  = {The Hidden Link Between RLHF and Contrastive Learning},
  author = {Xufei Lv and Kehai Chen and Haoyuan Sun and Xuefeng Bai and Min Zhang and Houde Liu and Kehai Chen},
  journal= {arXiv preprint arXiv:2506.22578},
  year   = {2025}
}