通过分解编码与条件化增强文本到视频生成中的运动
计算机视觉与模式识别
2024-11-01 v1
摘要
尽管取得了进展,文本到视频 (T2V) 生成仍面临产生真实运动的挑战。当前模型常产生静态或最小动态输出,无法捕获文本描述的复杂运动。这一问题源于文本编码内部的偏差,忽略了运动,以及 T2V 生成模型条件化机制不足。为此,我们提出一种新框架称为分解运动 (DEMO),通过将文本编码和条件化分别分解为内容和运动组件来增强 T2V 生成中的运动合成。我们的方法包括用于静态元素的内容编码器和用于时序动态的运动编码器,以及独立的内容和运动条件化机制。关键的是,我们引入文本-运动和视频-运动监督,以提高模型对运动的理解和生成能力。在 MSR-VTT、UCF-101、WebVid-10M、EvalCrafter 和 VBench 等基准上的评估表明,DEMO 在保持高视觉质量的同时,展现出生产运动动态更强大的能力。我们的ethods 显著推进了通过整合来自文本描述的全面运动理解来 advance T2V 生成。项目页面:https://PR-Ryan.github.io/DEMO-project/
引用
@article{arxiv.2410.24219,
title = {Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning},
author = {Penghui Ruan and Pichao Wang and Divya Saxena and Jiannong Cao and Yuhui Shi},
journal= {arXiv preprint arXiv:2410.24219},
year = {2024}
}
备注
Accepted at NeurIPS 2024, code available at https://github.com/PR-Ryan/DEMO