中文

语义感知 Wasserstein 策略正则化用于大语言模型对齐

机器学习 2026-02-03 v1 人工智能

摘要

大语言模型(LLM)通常使用基于强化学习的人类反馈(RLHF)进行人类偏好对齐。在该方法中,LLM 策略通过奖励最大化和对参考策略的 KL 散度正则化进行优化。然而,KL 散度及其 ff 散度变体仅比较相同索引处的标记概率,无法捕捉语义相似性。我们提出 Wasserstein 策略正则化(WPR),这是一种基于 entropy 正则化 Wasserstein 距离的语义感知正则化,适用于 RLHF 框架,包含标记空间的几何结构。距离的对偶形式将正则化表达为通过最优对偶变量对奖励施加的惩罚项,从而产生与标准 RL 算法兼容的可计算目标。经验上,我们的方法在 KL 散度和 ff 散度基线上均表现出色,展示了语义感知策略距离在对齐中的优势。我们的代码已公开于 https://github.com/aailab-kaist/WPR。

关键词

引用

@article{arxiv.2602.01685,
  title  = {Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment},
  author = {Byeonghu Na and Hyungho Na and Yeongmin Kim and Suhyeon Jo and HeeSun Bae and Mina Kang and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2602.01685},
  year   = {2026}
}

备注

Accepted at ICLR 2026