DreamDance:通过丰富2D姿态几何线索来动画化人类图像
计算机视觉与模式识别
2024-12-03 v1
摘要
本 work 提出了 DreamDance,一种仅使用骨架姿态序列作为条件输入来动画化人类图像的新方法。现有方法在高效用户友好方面难以生成连贯、高质量内容。具体而言,仅依赖2D姿态引导的基线方法缺乏3D信息线索,导致结果次优;而使用3D表示引导的方法实现更高质量,但涉及繁琐且耗时的流程。为此,DreamDance 通过引入一种高效扩散模型,从2D姿态丰富化3D几何线索,实现了具有各种引导的高质量人类图像动画。我们的关键洞察是,人类图像天然呈现出多层次相关性,从粗糙的骨架姿态逐步到细粒度的几何线索,再从这些几何线索到明确的外观细节。捕获此类相关性可丰富引导信号,从而促进帧内一致性和帧间一致性。具体而言,我们构建了 TikTok-Dance5K 数据集,包含5000个高质量舞蹈视频,具有详细的帧标注,包括人类姿态、深度图和法线图。接着,我们引入 Mutually Aligned Geometry Diffusion Model 来生成细粒度深度图和法线图,以实现丰富化的引导。最后,Cross-domain Controller 融合多级引导,有效地使用视频扩散模型来动画化人类图像。广泛的实验表明,我们的方法在人类图像动画方面实现了最佳性能。
引用
@article{arxiv.2412.00397,
title = {DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses},
author = {Yatian Pang and Bin Zhu and Bin Lin and Mingzhe Zheng and Francis E. H. Tay and Ser-Nam Lim and Harry Yang and Li Yuan},
journal= {arXiv preprint arXiv:2412.00397},
year = {2024}
}