X-Dyna:基于扩散模型的表达性动态人物图像动画
计算机视觉与模式识别
2025-01-22 v2
摘要
我们介绍 X-Dyna,一种 novel 的零样本、基于扩散的管线,用于通过从驾驶视频中获得的面部表情和身体动作来动画化单个人物图像,生成逼真且情境感知的动态效果,包括主体及其周围环境。基于以人体姿态控制为中心的先前方法,X-Dyna 解决了导致动态细节丢失的关键问题,增强了人类视频动画的逼真度。我们方法的核心是 Dynamics-Adapter,一种轻量级模块,有效地将参考外观上下文整合到扩散主干的空间注意力中,同时保持运动模块合成流畅和精细动态细节的能力。除了身体姿态控制,我们将局部控制模块与我们的模型连接,以捕获身份解耦的面部表情,促进面向增强现场动画逼真度的准确表达传递。此外,这些组件形成一个统一的框架,能够从 diverse的人类和场景视频中学习物理人类运动和自然场景动态。全面的定性和定量评估表明,X-Dyna 在与最先进的方法之间取得了显著优势,创建了高度逼真且富有表现力的动画。代码可在 https://github.com/bytedance/X-Dyna 获取。
引用
@article{arxiv.2501.10021,
title = {X-Dyna: Expressive Dynamic Human Image Animation},
author = {Di Chang and Hongyi Xu and You Xie and Yipeng Gao and Zhengfei Kuang and Shengqu Cai and Chenxu Zhang and Guoxian Song and Chao Wang and Yichun Shi and Zeyuan Chen and Shijie Zhou and Linjie Luo and Gordon Wetzstein and Mohammad Soleymani},
journal= {arXiv preprint arXiv:2501.10021},
year = {2025}
}
备注
Project page:https://x-dyna.github.io/xdyna.github.io/ Code:https://github.com/bytedance/X-Dyna Model:https://huggingface.co/Boese0601/X-Dyna