VSTAR:用于更长动态视频合成的生成式时序护理
计算机视觉与模式识别
2025-03-19 v2 人工智能
机器学习
多媒体
摘要
尽管在文本到视频(T2V)合成领域取得了显著进展,开源的 T2V 扩散模型仍难以生成动态变化且内容演变的长视频。它们倾向于合成准静态视频,忽略了文本提示中所蕴含的必要视觉变化。与此同时,将这些模型扩展以实现更长、更动态的视频合成往往在计算上难以实现。为此,我们提出了“生成式时序护理”(GTN)的概念,旨在在推理过程中动态地调整生成过程,以提高对时序动态性的控制,并实现长视频的生成。我们提出了一种 GTN 方法,称为 VSTAR,其包含两个关键要素:1)视频概要提示(VSP)——基于原始单一提示利用大语言模型自动生成视频概要,为更长视频中不同视觉状态提供准确的文本指导;2)时序注意力正则化(TAR)——一种用于细化预训练 T2V 扩散模型时序注意力单元的正则化技术,实现对视频动态性的控制。我们通过实验展示了该方法在生成更长、视觉更吸引人的视频方面优于现有开源 T2V 模型。我们还分析了在 VSTAR 与否下的时序注意力图,阐明了在缓解对所需视觉变化时间失控方面应用本方法的重要性。
引用
@article{arxiv.2403.13501,
title = {VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis},
author = {Yumeng Li and William Beluch and Margret Keuper and Dan Zhang and Anna Khoreva},
journal= {arXiv preprint arXiv:2403.13501},
year = {2025}
}
备注
Accepted at ICLR 2025. Code: https://github.com/boschresearch/VSTAR and project page: https://yumengli007.github.io/VSTAR