中文

从像素中看见姿态:在视觉 Transformer 中学习姿态感知表征

计算机视觉与模式识别 2023-06-16 v1

摘要

人类对环境感知常由环境中存在的各种姿态引导。许多计算机视觉任务,如人体动作识别与机器人模仿学习,依赖于基于姿态的实体,如人体骨架或机械臂。然而,传统的 Vision Transformer(ViT)模型均匀处理所有图像块,忽视了输入视频中有价值的姿态先验。我们认为,将姿态融入 RGB 数据有利于学习细粒度且与视角无关的表征。因此,我们引入了两种在 ViT 中学习姿态感知表征的策略。第一种方法称为姿态感知注意力块(PAAB),是一种即插即用的 ViT 块,在视频中的姿态区域上执行局部注意力。第二种方法称为姿态感知辅助任务(PAAT),提出了一种与主要 ViT 任务联合优化的辅助姿态预测任务。尽管二者功能不同,两种方法都成功学习了姿态感知表征,提升了多个不同下游任务的性能。我们在七个数据集上的实验揭示了两种姿态感知方法在三项视频分析任务上的有效性,其中 PAAT 略优于 PAAB。在真实世界动作识别中 PAAT 和 PAAB 均比其对应骨干 Transformer 提升高达 9.8%,在多视角机器人视频对齐中提升 21.8%。代码见 https://github.com/dominickrei/PoseAwareVT。

关键词

引用

@article{arxiv.2306.09331,
  title  = {Seeing the Pose in the Pixels: Learning Pose-Aware Representations in Vision Transformers},
  author = {Dominick Reilly and Aman Chadha and Srijan Das},
  journal= {arXiv preprint arXiv:2306.09331},
  year   = {2023}
}

备注

Pre-print. 18 pages