MotionMatcher:通过运动特征匹配实现文本到视频扩散模型的运动定制
计算机视觉与模式识别
2025-02-20 v1 人工智能
机器学习
摘要
文本到视频(T2V)扩散模型在从输入文本提示合成逼真视频方面展现出了极具前景的能力。然而,仅凭输入文本描述对精确的物体运动和摄像机取景的控制十分有限。在这项工作中,我们解决运动定制问题,其中参考视频作为运动指导。虽然大多数现有方法选择微调预训练的扩散模型以重建参考视频的帧间差异,但我们观察到此类策略会受到参考视频内容泄漏的影响,且无法准确捕捉复杂运动。为解决这一问题,我们提出了 MotionMatcher,一个在特征层面微调预训练 T2V 扩散模型的运动定制框架。MotionMatcher 不使用像素级目标,而是比较高层时空运动特征来微调扩散模型,确保精确的运动学习。出于内存效率与可访问性的考虑,我们利用包含大量关于视频运动先验知识的预训练 T2V 扩散模型来计算这些运动特征。在我们的实验中,我们展示了 SOTA 的运动定制性能,验证了我们框架的设计。
引用
@article{arxiv.2502.13234,
title = {MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching},
author = {Yen-Siang Wu and Chi-Pin Huang and Fu-En Yang and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2502.13234},
year = {2025}
}
备注
Project page: https://www.csie.ntu.edu.tw/~b09902097/motionmatcher/