中文

一种用于运动合成的统一掩码自编码器及块化骨架表示

计算机视觉与模式识别 2024-04-09 v2 图形学 机器人学

摘要

人体运动的合成传统上通过针对特定挑战的任务依赖模型来解决,例如预测未来运动或基于已知关键姿态填充中间姿态。在本文中,我们提出了一种称为 UNIMASK-M 的新型任务无关模型,它可以使用统一架构有效应对这些挑战。我们的模型在每个领域都获得了可与最先进水平相比或更好的性能。受视觉 Transformer(ViTs)启发,我们的 UNIMASK-M 模型将人体姿态分解为身体部位,以利用人体运动中存在的时空关系。此外,我们将各种基于姿态的运动合成任务重新表述为以不同掩码模式作为输入的重构建问题。通过显式告知我们的模型被掩码的关节,我们的 UNIMASK-M 对遮挡变得更加鲁棒。实验结果表明,我们的模型在 Human3.6M 数据集上成功预测了人体运动。此外,它在 LaFAN1 数据集上的运动中间插值任务中取得了最先进的结果,特别是在长过渡周期中。更多信息可在项目网站 https://evm7.github.io/UNIMASKM-page/ 找到。

关键词

引用

@article{arxiv.2308.07301,
  title  = {A Unified Masked Autoencoder with Patchified Skeletons for Motion Synthesis},
  author = {Esteve Valls Mascaro and Hyemin Ahn and Dongheui Lee},
  journal= {arXiv preprint arXiv:2308.07301},
  year   = {2024}
}

备注

Accepted to AAAI2024. Webpage: https://evm7.github.io/UNIMASKM-page/