ConvFormer:利用动态多头卷积注意力减少三维人体姿态估计 Transformer 模型参数量
计算机视觉与模式识别
2023-04-06 v1 机器学习
摘要
近来,全 Transformer 架构已取代事实上的卷积架构用于三维人体姿态估计任务。本文中,我们提出 \textbf{\textit{ConvFormer}},一种新颖的卷积 Transformer,其利用一种新的 \textbf{\textit{动态多头卷积自注意力}}机制进行单目三维人体姿态估计。我们设计了一个空间与时间卷积 Transformer,以全面建模单帧内以及整个运动序列全局上的人体关节关系。此外,我们为时间 ConvFormer 引入了一种新颖的 \textbf{\textit{时间关节轮廓}}概念,其针对关节特征的局部邻域立即融合完整时间信息。我们已在三个常用基准数据集 Human3.6M、MPI-INF-3DHP 和 HumanEva 上对我们的方法进行了定量与定性验证。我们进行了大量实验以确定最优超参数集合。这些实验表明,相对于先前的 Transformer 模型,我们实现了 \textbf{显著的参数量减少},同时在三个数据集上均达到了 State-of-the-Art(SOTA)或接近 SOTA。此外,我们在 H36M 上针对 GT 与 CPN 检测输入均取得了 Protocol III 的 SOTA。最后,我们在 MPI-INF-3DHP 数据集的所有三个指标上以及 HumanEva 在 Protocol II 下的所有三个受试者上均取得了 SOTA。
引用
@article{arxiv.2304.02147,
title = {ConvFormer: Parameter Reduction in Transformer Models for 3D Human Pose Estimation by Leveraging Dynamic Multi-Headed Convolutional Attention},
author = {Alec Diaz-Arias and Dmitriy Shin},
journal= {arXiv preprint arXiv:2304.02147},
year = {2023}
}