图卷积的重新思考:2D 到 3D 手部姿态提升
计算机视觉与模式识别
2026-05-14 v1
摘要
图卷积网络 (GCN) 广泛用于 3D 手部姿态估计,其中手骨被编码为固定邻接图。我们重新思考是否应以这种方式最有效地Incorporate手部拓扑于2D到3D提升。本文在FPHA基准上进行受控、参数匹配的消融实验,表明标准多头自注意力始终优于GCN基线。即使GCN通过多跳邻接和匹配参数强化,自注意力仍可将 MPJPE 从 12.36mm 降至 10.09mm。受骨架约束的图注意力网络可恢复大部分这一差距,表明输入依赖的聚合是主要的改进来源,而完全连接注意力则提供额外的提升。我们进一步表明,手部拓扑最有效地通过图距离位置编码作为软结构先验来引入,而非作为硬邻接约束。这些结果表明,对于手部姿态提升,自适应空间注意力是比固定图卷积更有效的归纳偏置。
引用
@article{arxiv.2605.13604,
title = {Rethinking Graph Convolution for 2D-to-3D Hand Pose Lifting},
author = {Chanyoung Kim and Donghyun Kim and Dong-Hyun Sim and Seong Jae Hwang and Youngjoong Kwon},
journal= {arXiv preprint arXiv:2605.13604},
year = {2026}
}