中文

基于无配对偏好优化的扩散语言模型对齐方法

机器学习 2025-11-13 v2 人工智能

摘要

扩散语言模型(diffusion language models, dLLMs)是自回归(AR)生成器的新兴替代方案,但与人类偏好对齐存在难题,因为序列对数似然无法精确计算,且配对偏好数据收集成本高昂。本文引入 ELBO-KTO 方法,结合用于扩散对数似然的 ELBO 近似量与基于前景理论的无配对偏好目标(Kahneman Tversky Optimization, KTO)。我们分析了 ELBO 替代方案引入的偏差和方差,并采用方差降低技术稳定训练中的梯度。应用于 LLaDA-8B-Instruct 时,ELBO-KTO 在 kto-mix-14k 和 UltraFeedback-Binary 上相对于基线模型实现了 65.9% 和 62.3% 的调整后胜率。在 GSM8K、MMLU 等下游任务及其他推理/知识基准测试中,ELBO-KTO 在 UltraFeedback-Binary 上训练的模型在相同解码条件下,与基线模型持平或表现更好。这一结果表明,无配对偏好优化是扩散 LLM 对齐的可行替代方案。

关键词

引用

@article{arxiv.2510.23658,
  title  = {Aligning Diffusion Language Models via Unpaired Preference Optimization},
  author = {Vaibhav Jindal and Hejian Sang and Chun-Mao Lai and Yanning Chen and Zhipeng Wang},
  journal= {arXiv preprint arXiv:2510.23658},
  year   = {2025}
}