超越静态帧:面向人体姿态估计的时序聚合-恢复视觉转换器
计算机视觉与模式识别
2026-03-09 v1
摘要
视觉转换器(ViT)最近因其强大的全局建模能力在2D人体姿态估计中取得了SOTA性能。然而,现有的ViT-based姿态估计器设计用于静态图像,独立处理每个帧,从而忽略了视频序列中存在的时序一致性。这一局限性常导致在涉及运动模糊、遮挡或焦外等挑战场景时预测不稳定。本文提出TAR-ViTPose,一种为视频-based 2D人体姿态估计量身定制的时序聚合-恢复视觉转换器(TAR-ViTPose)。TAR-ViTPose通过以即插即用方式聚合跨帧的时序线索,增强静态ViT表示,从而实现更稳健、更准确的姿态估计。为有效聚合跨帧在时间上对齐的关节特定特征,TAR-ViTPose引入关节中心时序聚合(JTA),为每个关节分配可学习的查询标记,以选择性地注意来自相邻帧的对应区域。此外,我们开发了全局恢复注意力(GRA),将聚合后的时序特征恢复到当前帧的标记序列中,同时充分保留全局上下文,以实现精确的关键点定位。大量实验表明,TAR-ViTPose在PoseTrack2017基准上显著优于单帧基线ViTPose,实现了+2.3 mAP的提升。此外,我们的方法优于现有的SOTA视频-based方法,同时在实际应用中实现了显著更高的运行帧率。项目页面:https://github.com/zgspose/TARViTPose。
引用
@article{arxiv.2603.05929,
title = {Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation},
author = {Hongwei Fang and Jiahang Cai and Xun Wang and Wenwu Yang},
journal= {arXiv preprint arXiv:2603.05929},
year = {2026}
}