中文

基于运动线性扩散 Transformer 的一致且可控图像动画

计算机视觉与模式识别 2025-08-12 v1

摘要

图像动画取得了显著进展,主要受益于扩散模型的强大生成能力。然而,保持静态输入图像的外观一致性并抑制生成动画中突然的运动过渡仍是持久挑战。虽然文本到视频(T2V)生成在扩散 Transformer 模型方面表现出色,但图像动画领域仍主要依赖基于 U-Net 的扩散模型,与最新的 T2V 方法相比存在滞后。此外,vanilla 自注意力机制在 Transformer 中的二次复杂度带来了沉重的计算负担,使得图像动画在资源方面尤其密集。为解决这些问题,我们提出了 MiraMo,一个旨在提高效率、外观一致性和运动平滑性的图像动画框架。具体而言,MiraMo 引入了三个关键要素:(1)用高效线性注意力取代 vanilla 自注意力的基础文本到视频架构以减少计算开销而保持生成质量;(2)一种新颖的运动残差学习范式,专注于建模运动动力学而非直接预测帧,从而提高时序一致性;(3)推理期间基于 DCT 的噪声细化策略以抑制突发运动伪影,并伴随一种动力学控制模块来平衡运动平滑性和表达性。广泛实验表明,MiraMo 在生成一致、平滑且可控的动画方面凌驼于最先进的方法,同时实现了加速的推理速度。此外,我们通过运动迁移和视频编辑任务演示了 MiraMo 的多样性。

关键词

引用

@article{arxiv.2508.07246,
  title  = {Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers},
  author = {Xin Ma and Yaohui Wang and Genyun Jia and Xinyuan Chen and Tien-Tsin Wong and Cunjian Chen},
  journal= {arXiv preprint arXiv:2508.07246},
  year   = {2025}
}

备注

Project Page: https://maxin-cn.github.io/miramo_project