中文

DynamiCtrl: 重构人类图像动画的基本结构与文本角色的高质量方案

计算机视觉与模式识别 2025-05-20 v2

摘要

扩散转换器 (DiT) 在视频生成方面表现突出,使其在特定任务中的应用日益受到关注。然而,将 DiT 应用于姿态引导的人类图像动画面临两个核心挑战:(a) 现有基于 U-Net 的姿态控制方法可能不适用于 DiT 架构;(b) 移除文本引导(如前述方法)常导致语义丢失和模型性能下降。为此,我们提出 DynamiCtrl,一种用于视频 DiT 架构的人类动画框架。具体而言,我们使用共享 VAE 编码器对人类图像和驱动姿态进行编码,统一进入共同潜在空间,保持姿态保真度,消除视频去噪期间专家姿态编码器的需求。为有效将姿态控制集成到 DiT 架构中,我们提出了一种新颖的姿态自适应层归一化模型。它通过对视觉标记进行条件化,将归一化化姿态特征注入去噪过程,实现跨 DiT 块的无缝且可扩展的姿态控制。此外,为克服文本移除的局限性,我们引入了“联合文本”范式,保留文本嵌入的作用以提供全局语义上下文。通过全局注意力块,将图像和姿态特征与文本特征对齐,增强语义一致性,利用预训练知识,实现多层次控制。实验验证了 DynamiCtrl 在基准数据集和自采集数据上的优越性(例如,实现最佳 LPIPS 为 0.166),展示了强大的角色控制能力和高质量合成效果。项目页面可访问于 https://gulucaptain.github.io/DynamiCtrl/。

关键词

引用

@article{arxiv.2503.21246,
  title  = {DynamiCtrl: Rethinking the Basic Structure and the Role of Text for High-quality Human Image Animation},
  author = {Haoyu Zhao and Zhongang Qi and Cong Wang and Qingping Zheng and Guansong Lu and Fei Chen and Hang Xu and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2503.21246},
  year   = {2025}
}

备注

16 pages, 11 figures