中文

一种用于视频中三维人体姿态估计的图注意力时空卷积网络

计算机视觉与模式识别 2020-10-21 v4 机器人学 图像与视频处理

摘要

时空信息是解决三维姿态估计中遮挡与深度歧义的关键。先前的方法要么聚焦于时间上下文,要么采用嵌入定长时空信息的局部到全局架构。迄今为止,尚未有有效方案能同时灵活地捕获变化的时空序列并有效实现实时的三维姿态估计。本工作中,我们通过注意力机制建模局部与全局空间信息,改进了人体骨架中姿态、局部运动学连接与对称性等运动学约束的学习。为适应单帧与多帧估计,采用膨胀时间模型处理变化的骨架序列。同样重要的是,我们精心设计了空间语义与时间依赖的交错以实现协同效应。为此,我们提出了一种简洁而有效的图注意力时空卷积网络(GAST-Net),其由交错的时序卷积与图注意力块组成。在两个人挑战性基准数据集(Human3.6M 与 HumanEva-I)及 YouTube 视频上的实验表明,我们的方法有效缓解了深度歧义与自遮挡,可推广至上半身估计,并在 2D 到 3D 视频姿态估计上取得具竞争力的性能。代码、视频与补充信息见:\href{http://www.juanrojas.net/gast/}{http://www.juanrojas.net/gast/}

关键词

引用

@article{arxiv.2003.14179,
  title  = {A Graph Attention Spatio-temporal Convolutional Network for 3D Human Pose Estimation in Video},
  author = {Junfa Liu and Juan Rojas and Zhijun Liang and Yihui Li and Yisheng Guan},
  journal= {arXiv preprint arXiv:2003.14179},
  year   = {2020}
}

备注

8 pages, 8 figures, 5 tables