中文

利用运动补丁探索面向3D人体运动-语言模型的视觉Transformer

计算机视觉与模式识别 2024-05-09 v1

摘要

为了构建3D人体运动与语言之间的跨模态潜在空间,获取大规模、高质量的人体运动数据至关重要。然而,与图像数据的丰富性不同,运动数据的稀缺性限制了现有运动-语言模型的性能。为此,我们引入了“运动补丁”——一种新的运动序列表示,并提议使用视觉Transformer(ViT)作为运动编码器,通过迁移学习从图像领域提取有用知识并应用于运动领域。这些运动补丁通过根据运动序列中的身体部位对骨架关节点进行分割和排序而创建,对不同骨架结构具有鲁棒性,并且可以视为ViT中的彩色图像补丁。我们发现,使用通过2D图像数据训练获得的ViT预训练权重进行迁移学习可以提升运动分析的性能,为解决运动数据有限的问题提供了一个有前景的方向。我们的大量实验表明,所提出的运动补丁与ViT联合使用,在文本到运动检索基准测试以及其他新颖的挑战性任务(如跨骨架识别、零样本运动分类和人体交互识别)中达到了最先进的性能,而这些任务目前因数据缺乏而受到阻碍。

关键词

引用

@article{arxiv.2405.04771,
  title  = {Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches},
  author = {Qing Yu and Mikihiro Tanaka and Kent Fujiwara},
  journal= {arXiv preprint arXiv:2405.04771},
  year   = {2024}
}

备注

Accepted to CVPR 2024, Project website: https://yu1ut.com/MotionPatches-HP/