MIMO:基于空间分解建模的可控角色视频合成
计算机视觉与模式识别
2025-06-12 v2
摘要
角色视频合成旨在生成逼真场景中可动画角色的写实视频。作为计算机视觉和图形学社区的一个基本问题,3D方法通常需要多视角捕获以进行逐案训练,这严重限制了其在短时间内对任意角色进行建模的适用性。近期的2D方法通过预训练扩散模型打破了这一限制,但它们在姿态通用性和场景交互方面存在困难。为此,我们提出了MIMO,这是一种新颖的框架,它不仅可以利用简单用户输入提供的可控属性(即角色、运动和场景)合成角色视频,还能在统一框架中同时实现对任意角色的高级可扩展性、对新颖3D运动的通用性以及对交互式真实世界场景的适用性。其核心思想是考虑到视频发生的固有3D特性,将2D视频编码为紧凑的空间码。具体而言,我们使用单目深度估计器将2D帧像素提升至3D,并基于3D深度将视频片段分解为分层结构中的三个空间组件(即主要人物、底层场景和浮动遮挡)。这些组件被进一步编码为规范身份码、结构化运动码和完整场景码,用作合成过程的控制信号。空间分解建模的设计实现了灵活的用户控制、复杂的运动表达以及用于场景交互的3D感知合成。实验结果证明了所提方法的有效性和鲁棒性。
引用
@article{arxiv.2409.16160,
title = {MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling},
author = {Yifang Men and Yuan Yao and Miaomiao Cui and Liefeng Bo},
journal= {arXiv preprint arXiv:2409.16160},
year = {2025}
}
备注
Project Page: https://menyifang.github.io/projects/MIMO/index.html