文本引导轨迹用于局部控制视频生成
计算机视觉与模式识别
2025-10-20 v1
摘要
文本到视频生成在视觉保真度方面取得了快速进展,但标准方法仍受限于对生成场景中主体构图的控制能力。先前的工作表明,添加局部文本控制信号(如边界框或分割掩码)可有所帮助。然而,这些方法在复杂场景中表现不佳,尤其在多目标设置下精度有限,缺乏清晰的单个轨迹与视觉实体之间的对应关系。我们引入文本引导轨迹(TGT),一种以轨迹与局部文本描述配对的方式进行视频生成的框架。我们提出位置感知交叉注意力(LACA)来整合这些信号,采用双CFG方案分别调制局部和全局文本指导。在此基础上,我们开发了数据处理管道,生成带有跟踪实体局部描述的轨迹,并标注了两百万个高质量视频剪辑以训练TGT。这些组件共同使TGT能够使用点轨迹作为直观的运动句柄,每个轨迹都与文本配对,以控制外观和运动。大量实验表明,TGT在视觉质量、文本对齐精度和运动可控性方面均优于先前方法。网站:https://textgroundedtraj.github.io。
引用
@article{arxiv.2510.15104,
title = {TGT: Text-Grounded Trajectories for Locally Controlled Video Generation},
author = {Guofeng Zhang and Angtian Wang and Jacob Zhiyuan Fang and Liming Jiang and Haotian Yang and Bo Liu and Yiding Yang and Guang Chen and Longyin Wen and Alan Yuille and Chongyang Ma},
journal= {arXiv preprint arXiv:2510.15104},
year = {2025}
}