扩散模型推理时扩展与引导的通用框架
机器学习
2025-07-21 v5 计算与语言
计算机视觉与模式识别
摘要
扩散模型在图像、视频、蛋白质设计和文本等模态上取得令人印象深刻的结果。然而,生成具有用户指定属性的样本仍是一个挑战。最近的研究提出通过微调模型以最大化捕获所需属性的奖励函数,但这些方法需要昂贵的训练且容易出现模式坍缩。在本工作中,我们提出了费曼-卡克(Feynman-Kac, FK)引导方法,这是一种用于引导扩散模型的推理时框架。FK 引导通过对多个相互作用的扩散过程(称为粒子)进行采样,并根据称为势函数的函数计算的分数对粒子进行重新采样来工作。势函数使用用于中间状态的奖励定义,并被选择使得高值表示该粒子将产生高奖励样本。我们探索了各种势函数、中间奖励和采样器的选择。我们在文本到图像和文本扩散模型上评估了 FK 引导。对于使用人类偏好奖励对文本到图像模型进行引导,我们发现 FK 引导一个 0.8B 参数模型在提示保真度方面优于 2.6B 参数微调模型,采样更快且无需训练。对于使用文本质量和特定文本属性奖励对文本扩散模型进行引导,我们发现 FK 引导生成更低的困惑度、更符合语言规范的输出,并实现了对如有毒性等属性的梯度无控制。我们的结果表明,即使使用即插即用的奖励,扩散模型的推理时扩展与引导仍可提供显著的样本质量提升和可控性优势。代码可在 https://github.com/zacharyhorvitz/Fk-Diffusion-Steering 获取。
引用
@article{arxiv.2501.06848,
title = {A General Framework for Inference-time Scaling and Steering of Diffusion Models},
author = {Raghav Singhal and Zachary Horvitz and Ryan Teehan and Mengye Ren and Zhou Yu and Kathleen McKeown and Rajesh Ranganath},
journal= {arXiv preprint arXiv:2501.06848},
year = {2025}
}