FancyVideo:通过跨帧文本引导实现动态且一致的视频生成
计算机视觉与模式识别
2025-08-18 v4
摘要
合成运动丰富且时间一致的视频仍然是人工智能中的一个挑战,尤其是在处理长时序时。现有的文本到视频(T2V)模型通常采用空间交叉注意力进行文本控制,等效地引导不同帧的生成而没有帧特定的文本引导。因此,模型理解提示中所传达的时间逻辑以及生成具有连贯运动的视频的能力受到限制。为解决这一局限,我们引入了FancyVideo,一种创新的视频生成器,通过精心设计的跨帧文本引导模块(CTGM)改进了现有的文本控制机制。具体而言,CTGM在交叉注意力的开始和结束处分别引入了时间信息注入器(TII)和时间亲和力精炼器(TAR),以实现帧特定的文本引导。首先,TII将帧特定信息从潜在特征注入到文本条件中,从而获得跨帧文本条件。然后,TAR沿时间维度精炼跨帧文本条件与潜在特征之间的相关矩阵。广泛的实验包括定量和定性评估证明了FancyVideo的有效性。我们的方法在EvalCrafter基准上取得了最先进的T2V生成结果,并促进了动态且一致视频的合成。注意,FancyVideo的T2V过程本质上涉及文本到图像步骤后接T+I2V。这意味着它也支持从用户图像生成视频,即图像到视频(I2V)任务。大量实验表明其性能同样出色。
引用
@article{arxiv.2408.08189,
title = {FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance},
author = {Jiasong Feng and Ao Ma and Jing Wang and Ke Cao and Zhanjie Zhang},
journal= {arXiv preprint arXiv:2408.08189},
year = {2025}
}
备注
Accepted by IJCAI 2025