中文

基于多模态规划和结构噪声初始化的文本到视频训练-free引导方法

计算机视觉与模式识别 2025-04-14 v1 人工智能 计算与语言

摘要

最近的文本到视频扩散模型研究显著提升了生成视频的视觉质量。然而,即便是最新的文本到视频模型在准确遵循文本描述方面仍存在挑战,尤其是当提示需要精确控制空间布局或物体轨迹时。近期研究尝试通过布局引导文本到视频模型,但这些方法在推理时需要微调或操作注意力图,显著增加内存要求,使得难以将大型文本到视频模型作为主干网络。为此,我们引入了Video-MSG,这是一种基于多模态规划和结构噪声初始化的文本到视频生成训练-free引导方法。Video-MSG包含三个步骤,其中前两个步骤创建Video Sketch,即为最终视频制定的细粒度时空计划,指定背景、前景及物体轨迹,形式为草稿视频帧。在最后一步,Video-MSG通过噪声反转和去噪引导下游文本到视频扩散模型。值得注意的是,Video-MSG在推理时无需额外内存的微调或注意力操控,使得更容易采用大型文本到视频模型。Video-MSG在多个文本到视频主干网络(VideoCrafter2和CogVideoX-5B)上,针对流行的文本到视频基准测试(T2VCompBench和VBench),展示了其在增强文本对齐方面的有效性。我们提供了关于噪声反转比例、不同背景生成器、背景物体检测以及前景物体分割的全面消融研究。

关键词

引用

@article{arxiv.2504.08641,
  title  = {Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization},
  author = {Jialu Li and Shoubin Yu and Han Lin and Jaemin Cho and Jaehong Yoon and Mohit Bansal},
  journal= {arXiv preprint arXiv:2504.08641},
  year   = {2025}
}

备注

Website: https://video-msg.github.io; The first three authors contributed equally