中文

人体运动Former:利用视觉Transformer迁移人体运动

计算机视觉与模式识别 2023-02-28 v2

摘要

人体运动迁移旨在将目标动态人物的运动迁移至源静态人物以进行运动合成。源人物与目标运动之间在大幅与细微运动变化上的准确匹配对提升迁移运动质量至关重要。本文提出Human MotionFormer,一种分层ViT框架,利用全局与局部感知分别捕捉大幅与细微运动匹配。其由两个ViT编码器(提取目标运动图像与源人体图像输入特征)及一个含多个级联块的ViT解码器(用于特征匹配与运动迁移)组成。在每个块中,我们将目标运动特征设为Query、源人物设为Key和Value,计算交叉注意力图以进行全局特征匹配。进一步,在全局交叉注意力计算后引入卷积层以改善局部感知。该匹配过程在变形与生成两支中均被执行以引导运动迁移。训练时,我们提出互学习损失,使变形与生成两支间实现协同监督以获得更好的运动表征。实验表明,我们的Human MotionFormer在定性与定量上均确立了新的SOTA性能。项目页:\url{https://github.com/KumapowerLIU/Human-MotionFormer}

关键词

引用

@article{arxiv.2302.11306,
  title  = {Human MotionFormer: Transferring Human Motions with Vision Transformers},
  author = {Hongyu Liu and Xintong Han and Chengbin Jin and Lihui Qian and Huawei Wei and Zhe Lin and Faqiang Wang and Haoye Dong and Yibing Song and Jia Xu and Qifeng Chen},
  journal= {arXiv preprint arXiv:2302.11306},
  year   = {2023}
}

备注

Accepted by ICLR2023