DyST-XL:用于组合文本到视频生成的动态布局规划与内容控制
计算机视觉与模式识别
2025-05-01 v2
摘要
组合文本到视频生成需要合成多个相互作用实体和精确时空关系的动态场景,这是扩散模型面临的关键挑战。现有方法因受限的交叉注意力机制和不足的物理感知推理,难以处理布局不连续、实体身份漂移以及不合情理的交互动态。为此,我们提出了 DyST-XL,一个无训练框架,通过帧感知控制来增强现成的文本到视频模型(如 CogVideoX-5B)。DyST-XL 集成了三项关键创新:(1) 动态布局规划器利用大语言模型(LLM)解析输入提示生成实体-属性图,并生成物理感知的关键帧布局,通过轨迹优化对中间帧进行插值;(2) 双提示受控注意力机制通过帧感知注意力掩码实现局部文本-视频对齐,对单个实体实现精确控制;(3) 实体一致性约束策略在去噪过程中将第一帧特征嵌入传递到后续帧,无需人工标注地保留对象身份。实验表明,DyST-XL 在组合文本到视频生成中表现卓越,显著提升复杂提示下的性能,弥合了无训练视频合成中的关键鸿沟。该代码已发布于 https://github.com/XiaoBuL/DyST-XL。
引用
@article{arxiv.2504.15032,
title = {DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation},
author = {Weijie He and Mushui Liu and Yunlong Yu and Zhao Wang and Chao Wu},
journal= {arXiv preprint arXiv:2504.15032},
year = {2025}
}
备注
9 pages, 6 figures