中文

基于注意力神经网络与膨胀卷积的视频三维人体姿态估计增强方法

计算机视觉与模式识别 2021-03-05 v1

摘要

注意力机制为学习具有增强隐式时间一致性的空间模型提供了一种序列预测框架。在这项工作中,我们展示了一种从二维到三维的系统设计,说明如何将传统网络及其他形式的约束纳入注意力框架,以学习姿态估计任务中的长程依赖。本文的贡献在于为端到端姿态估计的注意力模型设计与训练提供了一种系统方法,并具有以任意视频序列作为输入的灵活性与可扩展性。我们通过采用膨胀卷积的多尺度结构来调整时间感受野,从而实现这一点。此外,所提出的架构可轻松适配为因果模型,从而实现实时性能。任何现成的二维姿态估计系统,例如动作捕捉(Mocap)库,都可以即插即用地轻松集成。我们的方法达到了最先进的性能,并在 Human3.6M 数据集上将平均每个关节位置误差降低到 33.4 mm,优于现有方法。

关键词

引用

@article{arxiv.2103.03170,
  title  = {Enhanced 3D Human Pose Estimation from Videos by using Attention-Based Neural Network with Dilated Convolutions},
  author = {Ruixu Liu and Ju Shen and He Wang and Chen Chen and Sen-ching Cheung and Vijayan K. Asari},
  journal= {arXiv preprint arXiv:2103.03170},
  year   = {2021}
}