视频潜在流匹配:用于视频插值和外推的最优多项式投影
计算机视觉与模式识别
2025-02-05 v2 人工智能
机器学习
摘要
本文考虑了一种高效的视频建模过程,称为视频潜在流匹配(VLFM)。与先前随机采样潜在图像块进行视频生成的工作不同,我们的方法依赖于当前强大的预训练图像生成模型,对一种特定的、由文本引导的潜在图像块流进行建模,该流可被解码为随时间变化的视频帧。我们首先推测,视频的多幅图像在某个潜在空间中对时间是可微的。基于这一猜想,我们引入了HiPPO框架来近似多项式的最优投影,以生成概率路径。我们的方法获得了有界通用逼近误差和时间尺度鲁棒性的理论优势。此外,VLFM具备以任意帧率进行视频生成的内插和外推能力。我们在多个文本到视频数据集上进行了实验,以展示我们方法的有效性。
引用
@article{arxiv.2502.00500,
title = {Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation},
author = {Yang Cao and Zhao Song and Chiwun Yang},
journal= {arXiv preprint arXiv:2502.00500},
year = {2025}
}
备注
39 pages, 6 figures