无需训练的扩散模型对齐:采样恶魔
计算机视觉与模式识别
2025-02-28 v2 人工智能
机器学习
最优化与控制
机器学习
摘要
将扩散模型与用户偏好对齐一直是一个关键挑战。现有的扩散模型对齐方法要么需要重新训练,要么仅限于可微的奖励函数。为了解决这些局限性,我们提出了一种名为 Demon 的随机优化方法,用于在推理时引导去噪过程,而无需通过奖励函数进行反向传播或重新训练模型。我们的方法通过控制去噪步骤中的噪声分布,通过随机优化将密度集中在与高奖励对应的区域。我们提供了全面的理论和实证证据来支持和验证我们的方法,包括使用不可微奖励源(如视觉语言模型 API 和人类判断)的实验。据我们所知,所提出的方法是第一种用于扩散模型的推理时、无需反向传播的偏好对齐方法。我们的方法可以轻松集成到现有的扩散模型中,无需进一步训练。我们的实验表明,所提出的方法显著提高了文本到图像生成的平均美学评分。代码可在 https://github.com/aiiu-lab/DemonSampling 获取。
引用
@article{arxiv.2410.05760,
title = {Training-free Diffusion Model Alignment with Sampling Demons},
author = {Po-Hung Yeh and Kuang-Huei Lee and Jun-Cheng Chen},
journal= {arXiv preprint arXiv:2410.05760},
year = {2025}
}
备注
35 pages