TITAN-Guide:驯服推理时间对齐以实现引导式文本到视频扩散模型
计算机视觉与模式识别
2025-08-04 v1
摘要
在条件扩散模型的最新发展中,仍然需要大量的监督微调来对一类任务执行控制。通过现成模型进行引导的无训练条件控制是一种有利的替代方案,可以避免对基础模型进行进一步微调。然而,现有的无训练引导框架要么内存需求大,要么由于粗略估计而提供次优控制。这些缺点限制了其对需要大量计算资源的扩散模型(如文本到视频(T2V)扩散模型)的适用性。在这项工作中,我们提出了驯服推理时间对齐以实现引导式文本到视频扩散模型,即TITAN-Guide,它克服了内存空间问题,并在引导过程中提供了比同类方法更优的控制。特别是,我们开发了一种高效的方法来优化扩散潜在变量,而无需来自判别性引导模型的反向传播。具体而言,我们研究了用于引导式扩散任务的前向梯度下降法,并带有方向性指令的各种选项。在我们的实验中,我们证明了我们的方法在潜在优化过程中有效管理内存的有效性,而先前的方法则存在不足。我们提出的方法不仅最小化了内存需求,而且在一系列扩散引导基准测试中显著提升了T2V性能。代码、模型和演示可在https://titanguide.github.io获取。
引用
@article{arxiv.2508.00289,
title = {TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models},
author = {Christian Simon and Masato Ishii and Akio Hayakawa and Zhi Zhong and Shusuke Takahashi and Takashi Shibuya and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2508.00289},
year = {2025}
}
备注
Accepted to ICCV 2025