中文

MegActor-Σ:利用扩散Transformer解锁肖像动画中的灵活混合模态控制

计算机视觉与模式识别 2024-08-28 v1

摘要

扩散模型在肖像动画领域已展现出卓越的性能。然而,当前的方法依赖于视觉或音频模态来控制角色运动,未能充分利用混合模态控制的潜力。这一挑战源于难以平衡音频模态的弱控制强度和视觉模态的强控制强度。为了解决这个问题,我们引入了MegActor-Σ:一种混合模态条件扩散Transformer (DiT),它可以灵活地将音频和视觉模态控制信号注入肖像动画中。具体来说,我们通过利用DiT有前景的模型结构,并在DiT框架内通过先进模块集成音频和视觉条件,对其前身MegActor进行了重大改进。为了进一步实现混合模态控制信号的灵活组合,我们提出了一种“模态解耦控制”训练策略来平衡视觉和音频模态之间的控制强度,以及“幅度调整”推理策略来自由调节每种模态的运动幅度。最后,为了促进该领域的广泛研究,我们设计了几个数据集评估指标来筛选公共数据集,并仅使用这个筛选后的数据集来训练MegActor-Σ。大量实验证明了我们的方法在生成生动肖像动画方面的优越性,其性能优于先前在私有数据集上训练的方法。

关键词

引用

@article{arxiv.2408.14975,
  title  = {MegActor-$\Sigma$: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion Transformer},
  author = {Shurong Yang and Huadong Li and Juhao Wu and Minhao Jing and Linze Li and Renhe Ji and Jiajun Liang and Haoqiang Fan and Jin Wang},
  journal= {arXiv preprint arXiv:2408.14975},
  year   = {2024}
}