中文

面向直接语言模型对齐的原则性损失函数

机器学习 2025-09-26 v2 人工智能

摘要

语言模型与人类偏好对齐通常通过强化学习从人类反馈(Reinforcement Learning from Human Feedback, RLHF)实现。直接偏好优化(Direct Preference Optimization, DPO)通过在 optimal policy 与奖励函数之间建立直接映射,消除了对显式奖励模型的需求。然而,我们认为 DPO 损失函数在自身推导方面存在理论性位错,因为其鼓励对 logits 差值无限放大,可能导致训练不稳定和奖励攻击。本文提出一种新损失函数,直接从 RLHF 最优性条件推导而来。该损失函数针对 logits 差值的特定有限值进行目标设定——该值由底层奖励决定,而非其无限放大。我们提供理论分析,包括梯度比较,说明该方法避免了当偏好响应概率接近零时 DPO 所致的大梯度问题。这种固有的稳定性可防止奖励攻击,实现更有效的对齐。我们通过在 Qwen2.5-7B 模型上进行微调,表明该方法在标准 DPO 基线上实现了显著的胜率提升,同时在 Llama-3.1-8B 等更大模型中取得了竞争性能。

关键词

引用

@article{arxiv.2508.07137,
  title  = {A Principled Loss Function for Direct Language Model Alignment},
  author = {Yuandong Tan},
  journal= {arXiv preprint arXiv:2508.07137},
  year   = {2025}
}