中文

ConMo:面向零样本运动迁移的可控运动解耦与重组

计算机视觉与模式识别 2025-04-04 v1

摘要

文本到视频 (T2V) 生成技术的发展使得运动迁移成为可能,使其能够基于现有素材控制视频运动。然而,现有方法存在两个局限:1)难以处理多主体视频,无法实现对特定主体的运动迁移;2)难以保持运动的多样性和准确性,因为迁移至形状不同的主体上。为此,我们引入 ConMo,一个零样本框架,用于解耦和重组主体运动与相机运动。ConMo 仅通过主体掩码,从复杂轨迹中隔离 individual subject 与背景运动线索,并对其进行重组以用于目标视频生成。该方法实现了跨不同主体的更精准运动控制,提升了在多主体情境下的性能。此外,我们提出软引导用于重组阶段,控制保留原始运动程度以调整形状约束,辅助主体形状适应和语义转换。与先前方法不同,ConMo 解锁了广泛的应用场景,包括主体尺寸和位置编辑、主体移除、语义修改以及相机运动模拟。大量实验表明,ConMo 在运动保真度和语义一致性方面显著优于最先进的方法。代码已发布于 https://github.com/Andyplus1/ConMo。

关键词

引用

@article{arxiv.2504.02451,
  title  = {ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion Transfer},
  author = {Jiayi Gao and Zijin Yin and Changcheng Hua and Yuxin Peng and Kongming Liang and Zhanyu Ma and Jun Guo and Yang Liu},
  journal= {arXiv preprint arXiv:2504.02451},
  year   = {2025}
}