中文

图像随舞:基于协同解析-流视频合成

计算机视觉与模式识别 2021-10-29 v2

摘要

将人体运动从源人物迁移至目标人物在计算机视觉与图形学应用中具有巨大潜力。关键一步是在保留外观特征的同时操控连续的未来运动。已有工作要么依赖精心构建的3D人体模型,要么为每个目标人物单独训练模型,在实践中难以扩展。本文研究一种更通用的设定:旨在学习单一模型,在仅给定目标人物一张图像的条件下,将其运动从源视频简约地迁移至任意目标人物,称为协同解析-流网络(Collaborative Parsing-Flow Network, CPF-Net)。关于目标人物的信息匮乏使得在指定姿态变化下忠实保留外观极具挑战。为此,CPF-Net整合结构化人体解析与外观流以引导真实前景合成,并通过时空融合模块将其融入背景。具体而言,CPF-Net将问题解耦为人体解析序列生成、前景序列生成与最终视频生成三个阶段。人体解析生成阶段捕捉目标的姿态与身体结构;外观流有助于在合成帧中保持细节;人体解析与外观流的结合有效引导了具有真实外观的视频帧生成;专门设计的融合网络确保了时间连贯性。我们进一步收集了大量人体舞蹈视频以推进该研究领域。定量与定性结果均表明,我们的方法相较以往方法显著提升,且能基于任意输入人物图像生成引人注目且照片级真实的目标视频。所有源代码与数据集将于https://github.com/xiezhy6/CPF-Net发布。

关键词

引用

@article{arxiv.2110.14147,
  title  = {Image Comes Dancing with Collaborative Parsing-Flow Video Synthesis},
  author = {Bowen Wu and Zhenyu Xie and Xiaodan Liang and Yubei Xiao and Haoye Dong and Liang Lin},
  journal= {arXiv preprint arXiv:2110.14147},
  year   = {2021}
}

备注

TIP 2021