视频扩散模型是训练-free 运动解释器与控制器
计算机视觉与模式识别
2024-11-13 v3
摘要
视频生成主要旨在建模真实且可定制的跨帧运动,使理解和控制运动成为关键议题。大多数基于扩散的视频运动研究聚焦于通过训练方法进行运动定制,这些方法需要大量训练资源,并且需要为不同模型重新训练。关键在于,这些方法未探索视频扩散模型如何在其特征中编码跨帧运动信息,缺乏对其有效性的可解释性和透明度。为回答此问题,本文提出一种新颖视角来理解、局部化和操控视频扩散模型中的运动感知特征。通过使用主成分分析 (PCA) 进行分析,我们的工作揭示了视频扩散模型中已存在鲁健的运动感知特征。我们提出了一种新的 MOtion FeaTure (MOFT),通过消除内容相关信息并筛选运动通道。MOFT 提供了一组独特的优势,包括能够编码全面运动信息、解释性清晰、无需训练即可提取,以及跨不同架构的通用性。利用 MOFT,我们提出一种新的训练-free 视频运动控制框架。该方法在生成自然且忠实运动方面表现出竞争力,提供了架构无关的见解,并在各种下游任务中具有适用性。
关键词
引用
@article{arxiv.2405.14864,
title = {Video Diffusion Models are Training-free Motion Interpreter and Controller},
author = {Zeqi Xiao and Yifan Zhou and Shuai Yang and Xingang Pan},
journal= {arXiv preprint arXiv:2405.14864},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Project Page: https://xizaoqu.github.io/moft/