统一文本-图像到视频生成:一种无需训练的灵活视觉条件控制方法
计算机视觉与模式识别
2026-03-17 v3 机器学习
摘要
文本-图像到视频(TI2V)生成是利用语义和视觉条件进行可控视频生成的关键问题。现有方法大多通过对文本到视频(T2V)基础模型进行微调来添加视觉条件,这不仅资源成本高昂,且仅限于少数预定义的条件设置。为解决这些限制,我们提出了一种具有灵活视觉条件控制的TI2V生成统一框架。此外,我们提出了一种创新的免训练方法FlexTI2V,该方法可在任意位置对任意数量的图像进行条件控制,作用于T2V基础模型。具体而言,我们首先将条件图像反演为潜在空间中的噪声表示。然后,在T2V模型的去噪过程中,我们的方法采用一种新颖的随机块交换策略,通过局部图像块将视觉特征融入视频表示。为平衡创造性与保真度,我们使用动态控制机制来调整对每个视频帧的视觉条件控制强度。大量实验验证,我们的方法显著超越了以往的免训练图像条件控制方法。我们的方法还能泛化到基于UNet和基于Transformer的架构。
引用
@article{arxiv.2505.20629,
title = {Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning},
author = {Bolin Lai and Sangmin Lee and Xu Cao and Xiang Li and James M. Rehg},
journal= {arXiv preprint arXiv:2505.20629},
year = {2026}
}
备注
27 pages, 10 figures, 7 tables