中文

MoCha:无需结构引导的端到端视频角色替换

计算机视觉与模式识别 2026-01-15 v2

摘要

由于缺乏成对视频数据,使用用户提供的身份进行可控视频角色替换仍然是一个具有挑战性的问题。先前的工作主要依赖于基于重建的范式,该范式需要逐帧分割掩码和显式结构引导(例如骨架、深度)。然而,这种依赖严重限制了它们在涉及遮挡、角色与物体交互、异常姿势或复杂光照等复杂场景中的泛化能力,通常会导致视觉伪影和时间不一致性。在本文中,我们提出了 MoCha,这是一个开创性框架,仅需单帧任意掩码即可绕过这些限制。为了有效适应多模态输入条件并增强面部身份,我们引入了条件感知 RoPE 并采用了基于 RL 的后训练阶段。此外,为了克服合格成对训练数据的稀缺性,我们提出了一套全面的数据构建流程。具体而言,我们设计了三个专用数据集:使用 Unreal Engine 5 (UE5) 构建的高保真渲染数据集、由当前肖像动画技术合成的表情驱动数据集,以及从现有视频-掩码对中导出的增强数据集。大量实验表明,我们的方法显著优于现有的 SOTA 方法。我们将发布代码以促进进一步研究。更多详情请参阅我们的项目页面:orange-3dv-team.github.io/MoCha

关键词

引用

@article{arxiv.2601.08587,
  title  = {MoCha:End-to-End Video Character Replacement without Structural Guidance},
  author = {Zhengbo Xu and Jie Ma and Ziheng Wang and Zhan Peng and Jun Liang and Jing Li},
  journal= {arXiv preprint arXiv:2601.08587},
  year   = {2026}
}

备注

10 pages, 9 figures