基于噪声追踪对的校正流离线偏好优化
计算机视觉与模式识别
2026-05-12 v1
摘要
现有的文本到图像模型偏好数据集通常仅存储最终的胜出/失败图像。这种表示对于校正流(RF)模型是不够的,因为其生成自然地由特定的先验噪声样本索引,并遵循近乎直线的去噪轨迹。相比之下,先前针对扩散模型的 DPO 风格对齐通常使用独立的前向加噪过程来估计轨迹,这可能与真实的反向动力学不匹配,并引入不必要的方差。我们提出了先验噪声感知偏好优化(PNAPO),这是一种专为校正流量身定制的离策略对齐框架。PNAPO 通过保留用于生成每张胜出/失败图像的配对先验噪声来增强偏好数据,将标准的(提示,胜出,失败)三元组转化为六元组。利用 RF 的直线特性,我们通过噪声-图像插值估计中间状态,这约束了轨迹估计空间,并为偏好优化产生了更紧密的代理目标。此外,我们引入了一种动态正则化策略,该策略基于(i)胜出者和失败者之间的奖励差距以及(ii)训练进度来调整 DPO 正则化,从而提高了稳定性和样本效率。在最先进的 RF T2I backbone 上的实验表明,PNAPO 持续提升偏好指标,同时大幅减少训练计算量。
引用
@article{arxiv.2605.09433,
title = {Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs},
author = {Yunhong Lu and Qichao Wang and Hengyuan Cao and Xiaoyin Xu and Min Zhang},
journal= {arXiv preprint arXiv:2605.09433},
year = {2026}
}
备注
Accepted by ICML 2026