TIV-Diffusion:面向文本驱动图像到视频生成的以对象为中心的运动
计算机视觉与模式识别
2024-12-17 v2
摘要
文本驱动的图像到视频生成(TI2V)旨在给定首帧及相应文本描述的情况下生成可控视频。该任务的主要挑战在于两部分:(i) 如何识别目标对象并确保运动轨迹与文本描述之间的一致性;(ii) 如何提升生成视频的主观质量。为应对上述挑战,我们提出了一种基于扩散的新型 TI2V 框架,称为 TIV-Diffusion,通过以对象为中心的文本-视觉对齐,旨在基于不同对象的文本描述运动实现精确控制与高质量视频生成。具体而言,我们通过尺度-偏移调制融入融合的文本与视觉知识,使 TIV-Diffusion 模型能够感知文本描述的对象及其运动轨迹。此外,为缓解对象消失以及对象与运动未对齐的问题,我们引入了以对象为中心的文本-视觉对齐模块,该模块通过解耦参考图像中的对象并将文本特征与每个对象单独对齐,降低了对象/运动未对齐的风险。基于上述创新,与现有 TI2V 方法相比,我们的 TIV-Diffusion 实现了 SOTA 的高质量视频生成。
引用
@article{arxiv.2412.10275,
title = {TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation},
author = {Xingrui Wang and Xin Li and Yaosi Hu and Hanxin Zhu and Chen Hou and Cuiling Lan and Zhibo Chen},
journal= {arXiv preprint arXiv:2412.10275},
year = {2024}
}
备注
Accepted by AAAI 2025