MoTrans:基于文本驱动视频扩散模型的定制化运动迁移
计算机视觉与模式识别
2024-12-03 v1
摘要
现有的预训练文本到视频 (T2V) 模型在生成带有基本运动或相机移动的逼真视频方面表现出色,但在生成复杂的人类运动时存在显著局限。当前 efforts 主要聚焦在针对包含特定运动的小视频集进行微调,往往难以有效分离运动与外观,削弱对运动模式的建模能力。为此,我们提出 MoTrans,一种定制化运动迁移方法,使其能够在新情境中生成类似的运动。具体而言,我们引入基于多模态大语言模型 (MLLM) 的重标注器,以更关注外观地扩展初始提示;同时设计外观注入模块,将视频帧的外观先验引入运动建模过程。这些来自重标注提示和视频帧的互补多模态表征促进了外观建模,便于外观与运动的分离。此外,我们设计运动特定嵌入以进一步增强运动模式的建模。实验结果表明,该方法有效学习了来自单个或多个参考视频的特定运动模式,在定制化视频生成方面优于现有方法。
引用
@article{arxiv.2412.01343,
title = {MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models},
author = {Xiaomin Li and Xu Jia and Qinghe Wang and Haiwen Diao and Mengmeng Ge and Pengxiang Li and You He and Huchuan Lu},
journal= {arXiv preprint arXiv:2412.01343},
year = {2024}
}
备注
Accepted by ACM MM 2024, code will be released in https://github.com/XiaominLi1997/MoTrans