中文

MagicMirror:视频扩散Transformer中的身份保持视频生成

计算机视觉与模式识别 2025-11-25 v2

摘要

我们提出了MagicMirror,一个用于生成具有电影级质量和动态运动的身份保持视频的框架。尽管视频扩散模型的最新进展在文本到视频生成方面展示了令人印象深刻的能力,但在保持身份一致性的同时产生自然运动仍然具有挑战性。先前的方法要么需要针对特定人物的微调,要么难以平衡身份保持与运动多样性。基于视频扩散Transformer,我们的方法引入了三个关键组件:(1)一个双分支面部特征提取器,用于捕获身份和结构特征;(2)一个轻量级跨模态适配器,带有条件自适应归一化,用于高效的身份集成;(3)一个两阶段训练策略,结合合成身份对和视频数据。大量实验表明,MagicMirror有效地平衡了身份一致性与自然运动,在多个指标上优于现有方法,同时仅需增加最少的参数。代码和模型将公开发布。

关键词

引用

@article{arxiv.2501.03931,
  title  = {MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers},
  author = {Yuechen Zhang and Yaoyang Liu and Bin Xia and Bohao Peng and Zexin Yan and Eric Lo and Jiaya Jia},
  journal= {arXiv preprint arXiv:2501.03931},
  year   = {2025}
}

备注

ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/