中文

基于4D骨骼增强的上下文感知序列对齐

计算机视觉与模式识别 2022-04-27 v1

摘要

视频中细粒度人类动作的时间对齐在计算机视觉、机器人与混合现实中有诸多重要应用。最先进的方法借助强大的深度卷积神经网络直接学习基于图像的嵌入空间。尽管直观,其结果远不能令人满意,对齐后的视频在未加额外后处理步骤时表现出严重的时间不连续。近期野外人体与手部姿态估计的进展为处理视频中人类动作对齐任务提供了新途径。本工作中,基于现成人体姿态估计器,我们提出一种新颖的上下文感知自监督学习架构以对齐动作序列。我们将其命名为CASA。具体而言,CASA采用自注意力与交叉注意力机制融入人类动作的空间与时间上下文,可解决时间不连续问题。此外,我们引入一种由新颖4D增强技术(针对3D骨架表示)赋能的自监督学习方案。我们系统性地评估了方法的关键组件。在三个公开数据集上的实验表明,CASA相较先前最先进方法显著提升了相位进度与Kendall's Tau分数。

关键词

引用

@article{arxiv.2204.12223,
  title  = {Context-Aware Sequence Alignment using 4D Skeletal Augmentation},
  author = {Taein Kwon and Bugra Tekin and Siyu Tang and Marc Pollefeys},
  journal= {arXiv preprint arXiv:2204.12223},
  year   = {2022}
}

备注

Project page: http://www.taeinkwon.com/projects/casa. Accepted to CVPR 2022 Oral