中文

让你的图像随你的动作移动!——隐式多目标多动作迁移

计算机视觉与模式识别 2026-03-16 v2

摘要

运动迁移已成为可控视频生成的热门方向,但现有方法大多聚焦于单目标场景,难以处理多个对象需要不同运动模式的情况。本文提出FlexiMMT,是首个实现图像到视频(I2V)多目标多动作迁移的隐式框架。给定静态多目标图像和多个参考视频,FlexiMMT独立提取运动表示并精确分配给不同对象,支持灵活的重组和任意运动到对象的映射。为解决跨目标运动 entanglement 的核心挑战,本文引入运动解耦掩码注意力机制,使用对象特定掩码约束注意力,确保运动和文本标记仅影响其指定区域。进一步提出差异化掩码传播机制,直接从扩散注意力中推导出对象特定掩码,并高效地跨帧传播。大量实验表明,FlexiMMT在I2V基于多目标多动作迁移方面实现了精确、可组合且领先的性能。我们的项目页面为:https://ethan-li123.github.io/FlexiMMT_page/。

关键词

引用

@article{arxiv.2603.01000,
  title  = {Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer},
  author = {Yuze Li and Dong Gong and Xiao Cao and Junchao Yuan and Dongsheng Li and Lei Zhou and Yun Sing Koh and Cheng Yan and Xinyu Zhang},
  journal= {arXiv preprint arXiv:2603.01000},
  year   = {2026}
}

备注

15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/