OnlyFlow: 基于光流的视频扩散模型运动条件控制
计算机视觉与模式识别
2025-10-31 v2 机器学习
摘要
我们研究文本到视频生成任务中精确控制的问题,适用于相机运动控制和视频到视频编辑等多种应用。大多数解决此问题的方法依赖用户定义的控制,如二值掩码或相机运动嵌入。我们提出 OnlyFlow,一种利用从输入视频中首先提取的光流来条件生成视频运动的方法。使用文本提示和输入视频,OnlyFlow 允许用户生成同时遵循输入视频运动和文本提示的视频。这通过应用于输入视频的光流估计模型实现,其输出再送入可训练的光流编码器。输出特征图随后被注入文本到视频的主干模型。我们通过定量、定性和用户偏好研究表明,OnlyFlow 在广泛任务上与最先进方法相比表现优异,尽管 OnlyFlow 并未专门针对这些任务训练。因此,OnlyFlow 构成了一种通用、轻量且高效的文本到视频生成运动控制方法。模型和代码将在 GitHub 和 HuggingFace 上公开。
引用
@article{arxiv.2411.10501,
title = {OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models},
author = {Mathis Koroglu and Hugo Caselles-Dupré and Guillaume Jeanneret Sanmiguel and Matthieu Cord},
journal= {arXiv preprint arXiv:2411.10501},
year = {2025}
}
备注
8 pages, 1 supplementary page, 9 figures