中文

MagicInfinite:用你的文字和声音生成无限说话视频

计算机视觉与模式识别 2025-03-11 v1

摘要

我们提出了 MagicInfinite,一个新颖的扩散 Transformer(DiT)框架,它克服了传统肖像动画的局限性,在多种角色类型——逼真的人类、全身人物和风格化动漫角色——中提供高保真结果。它支持多种面部姿势,包括背面视角,并通过输入掩码为多角色场景中的说话者进行精确指定,从而实现单角色或多角色动画。我们的方法通过三项创新应对关键挑战:(1)采用滑动窗口去噪策略的 3D 全注意力机制,实现具有时间连贯性和跨多种角色风格视觉质量的无限视频生成;(2)两阶段课程学习方案,整合音频用于唇形同步、文本用于表现力动态、参考图像用于身份保持,实现对长序列的灵活多模态控制;以及(3)带有自适应损失函数的区域特定掩码,以平衡全局文本控制和局部音频引导,支持特定说话者的动画。通过我们创新的统一步数和 CFG 蒸馏技术提升了效率,与基线模型相比实现了 20 倍的推理速度提升:在 8 块 H100 GPU 上,10 秒内生成 10 秒的 540x540p 视频,或在 30 秒内生成 720x720p 视频,且无质量损失。在我们新的基准测试上的评估表明,MagicInfinite 在各种场景下的音视频唇形同步、身份保持和动作自然度方面均具有优越性。该项目公开于 https://www.hedra.com/,示例见 https://magicinfinite.github.io/。

关键词

引用

@article{arxiv.2503.05978,
  title  = {MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice},
  author = {Hongwei Yi and Tian Ye and Shitong Shao and Xuancheng Yang and Jiantong Zhao and Hanzhong Guo and Terrance Wang and Qingyu Yin and Zeke Xie and Lei Zhu and Wei Li and Michael Lingelbach and Daquan Zhou},
  journal= {arXiv preprint arXiv:2503.05978},
  year   = {2025}
}

备注

MagicInfinite is publicly accessible at https://www.hedra.com/. More examples are at https://magicinfinite.github.io/