DeRaDiff:去噪时间重新对齐扩散模型
机器学习
2026-02-23 v2
摘要
近期进展将扩散模型与人类偏好对齐,以增加审美吸引力并缓解痕迹和偏差。此类方法旨在最大化与更高奖励对齐的条件输出分布,同时不远离预训练先验。这通常通过 KL (Kullback Leibler) 正则化来实现。因此,一个核心问题仍然存在:如何选择合适的正则化强度?正则化强度过高会导致对齐受限,过低则导致“奖励黑客”。这使得选择正确的正则化强度变得高度非平凡。现有方法通过在多个正则化强度下对齐预训练模型,然后选择最佳强度来进行遍历。不幸的是,这在计算上昂贵。我们引入 DeRaDiff,一种去噪时间重新对齐程序。该程序在对齐预训练模型一次后,可在抽样期间调节正则化强度,以模拟在不同正则化强度下训练的模型,而无需额外训练或微调。通过将解码时间重新对齐从语言扩展到扩散模型,DeRaDiff 通过替换逆步骤参考分布为对齐后参考后验的几何混合,实现了对连续潜在变量的迭代预测,从而在常见调度器下产生闭式更新,并提供一个可调参数 lambda,用于动态控制。我们的实验表明,跨越多个文本图像对齐和图像质量指标,我们的方法始终为在不同正则化强度下从头对齐的模型提供强有力的近似。因此,我们的方法为寻找最佳强度提供了一种高效途径,消除了昂贵对齐遍历的需求,从而显著降低了计算成本。
引用
@article{arxiv.2601.20198,
title = {DeRaDiff: Denoising Time Realignment of Diffusion Models},
author = {Ratnavibusena Don Shahain Manujith and Teoh Tze Tzun and Kenji Kawaguchi and Yang Zhang},
journal= {arXiv preprint arXiv:2601.20198},
year = {2026}
}