基于节点中心解耦时空推理的视频人体姿态估计:NCSTR
计算机视觉与模式识别
2026-03-24 v1
摘要
视频人体姿态估计面临运动模糊、遮挡和复杂时空动力学等挑战。现有方法常依赖热图或隐式时空特征聚合,这限制了联合拓扑的表达力且削弱了跨帧的一致性。为此,本文提出一种新颖的节点中心框架,显式地整合视觉、时空和结构推理,以实现精准姿态估计。首先,我们设计了基于视觉-时空速度的关节嵌入,将亚像素关节线索和跨帧运动融合,以构建基于外观和运动的表示。随后,我们引入注意力驱动的姿态查询编码器,对关节热图和帧特征施加注意力,将关节表示映射到姿态感知的节点空间,从而生成图像条件的关节感知节点嵌入。基于这些节点嵌入,我们提出了双分支解耦时空注意力图,专门建模时序传播和空间约束推理。最后,提出了节点空间专家融合模块,用于自适应融合两个分支的互补输出,整合局部和全局线索以进行最终关节预测。广泛的实验表明,我们的方法在三个广泛使用的视频姿态基准数据集上超越了最先进的方法。结果凸显了显式节点中心推理的价值,为推动视频人体姿态估计提供了新的视角。
引用
@article{arxiv.2603.20323,
title = {NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation},
author = {Quang Dang Huynh and Xuefei Yin and Andrew Busch and Hugo G. Espinosa and Alan Wee-Chung Liew and Matthew T. O. Worsey and Yanming Zhu},
journal= {arXiv preprint arXiv:2603.20323},
year = {2026}
}