中文

Dancing Avatar:基于图像扩散模型的姿态与文本引导人体运动视频合成

计算机视觉与模式识别 2023-08-16 v1 人工智能

摘要

数字领域中创建逼真虚拟形象的需求增长导致对由文本描述和姿态引导生成高质量人体视频的需求增加。我们提出 Dancing Avatar,旨在制作由姿态和文本线索驱动的人体运动视频。我们的方法采用预训练的 T2I 扩散模型以自回归方式生成每个视频帧。创新核心在于我们熟练利用 T2I 扩散模型连续生成视频帧同时保持上下文相关性。我们克服了在不同姿态下保持人物角色与服装一致性,以及在不同人体运动间维持背景连续性的困难。为确保整段视频中人物外观一致,我们设计了一个帧内对齐模块。该模块将文本引导合成的人物角色知识融入预训练 T2I 扩散模型,并协同来自 ChatGPT 的见解。为保持背景连续性,我们提出一个背景对齐流程,融合来自 segment anything 和图像修复技术的见解。此外,我们提出一个帧间对齐模块,其受自回归流程启发以增强相邻帧间的时间一致性,其中前一帧引导当前帧的合成过程。与 SOTA 方法的比较表明,Dancing Avatar 相比现有 SOTA 方法能够生成在人物与背景保真度以及时间连贯性方面质量显著更优的人体视频。

关键词

引用

@article{arxiv.2308.07749,
  title  = {Dancing Avatar: Pose and Text-Guided Human Motion Videos Synthesis with Image Diffusion Model},
  author = {Bosheng Qin and Wentao Ye and Qifan Yu and Siliang Tang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2308.07749},
  year   = {2023}
}

备注

11 pages, 3 figures