中文

RealisDance-DiT: 面向野外可控人物动画的简单而强大的基线

计算机视觉与模式识别 2025-04-22 v1

摘要

可控人物动画仍是一个具有挑战性的问题,尤其是在处理稀有姿势、手绘人物、人物-物体相互作用、复杂照明和动态场景时。为此,先前工作主要集中于通过精细的旁路网络注入姿势和外观指导,但往往难以泛化到开放世界场景。在本文中,我们提出了一种新观点:只要基础模型足够强大,简单的模型修改配合灵活的微调策略即可在很大程度上解决上述问题,迈出一步通向野外可控人物动画。具体而言,我们引入 RealisDance-DiT,基于 Wan-2.1 视频基础模型构建。我们的充分分析揭示,广泛采用的 Reference Net 设计对于大型 DiT 模型并不次佳。相反,我们证明了对基础模型架构进行最小修改即可获得惊人的强大基线。我们进一步提出了低噪声预热和“大批量小迭代”策略,以加速模型在微调期间的收敛,同时最大限度地保留基础模型的先验知识。此外,我们引入了新的测试数据集,捕获多样化的真实世界挑战,补充现有基准(如 TikTok 数据集和 UBC 时装视频数据集),全面评估所提方法。大量实验表明,RealisDance-DiT 在现有方法上取得显著优势。

关键词

引用

@article{arxiv.2504.14977,
  title  = {RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild},
  author = {Jingkai Zhou and Yifan Wu and Shikai Li and Min Wei and Chao Fan and Weihua Chen and Wei Jiang and Fan Wang},
  journal= {arXiv preprint arXiv:2504.14977},
  year   = {2025}
}

备注

Project Page: https://thefoxofsky.github.io/project_pages_new/RealisDance-DiT/index