Moaw: 释放视频扩散模型的运动感知能力
计算机视觉与模式识别
2026-01-21 v1
摘要
在大规模数据集上训练的视频扩散模型,自然地捕捉了跨帧共享特征的对应关系。最近的工作已利用此属性进行零样本设置下的光流预测和跟踪等任务。受这些发现的启发,我们研究了监督训练是否能更充分地利用视频扩散模型的跟踪能力。为此,我们提出了Moaw,一个释放视频扩散模型运动感知能力并利用其促进运动迁移的框架。具体来说,我们训练一个用于运动感知的扩散模型,将其模态从图像到视频生成转变为视频到密集跟踪。然后,我们构建一个运动标记数据集,以识别编码最强运动信息的特征,并将它们注入到结构相同的视频生成模型中。由于两个网络之间的同质性,这些特征可以以零样本方式自然适应,无需额外的适配器即可实现运动迁移。我们的工作为连接生成式建模和运动理解提供了一种新范式,为更统一和可控的视频学习框架铺平了道路。
引用
@article{arxiv.2601.12761,
title = {Moaw: Unleashing Motion Awareness for Video Diffusion Models},
author = {Tianqi Zhang and Ziyi Wang and Wenzhao Zheng and Weiliang Chen and Yuanhui Huang and Zhengyang Huang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2601.12761},
year = {2026}
}