图谱与跳过 Transformer:高效 3D 人体姿态估计中的空间与时间建模
计算机视觉与模式识别
2024-10-23 v1
摘要
近年来,单目 3D 人体姿态估计(HPE)中的 2D 到 3D 姿态提升吸引了广泛关注。基于图神经网络(GNN)和基于 Transformer 的方法已成为主流架构,due to their advanced spatial and temporal feature learning capacities。然而,现有方法通常在空间和时间域中构建关节级和帧级注意力对齐,导致稠密连接引入显著的局部冗余和计算开销。本文提出一种全局方法,利用时空信息实现高效 3D HPE,构建简洁的图谱-跳过 Transformer 架构。具体而言,在空间编码阶段,采用粗粒度身体部位构建具有完全数据驱动自适应拓扑的空间图网络,确保模型在各种姿态下具有灵活性和通用性。在时间编码与解码阶段,提出一种简单而有效的跳过 Transformer,用于捕获长程时序依赖并实现层次化特征聚合。还开发了一种直截的“数据滚动”策略,以将动态信息引入 2D 姿态序列。在 Human3.6M、MPI-INF-3DHP 和 Human-Eva 数据集上进行了广泛实验。G-SFormer 系列方法仅需约占以往 SOTA 方法参数的 10%,显著降低了计算复杂度。此外,G-SFormer 也显示出对检测到的 2D 姿态不准确具有出色的鲁棒性。
引用
@article{arxiv.2407.02990,
title = {Graph and Skipped Transformer: Exploiting Spatial and Temporal Modeling Capacities for Efficient 3D Human Pose Estimation},
author = {Mengmeng Cui and Kunbo Zhang and Zhenan Sun},
journal= {arXiv preprint arXiv:2407.02990},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication