基于姿态感知视频变换器的端到端多人姿态估计
计算机视觉与模式识别
2025-12-03 v2
摘要
现有的多人视频姿态估计方法通常采用两级流程:首先检测每帧中的个体,然后进行单人姿态估计的时序建模。这种设计依赖于检测、RoI 裁剪和非极大值抑制 (NMS) 等启发式操作,限制了准确率和效率。本文提出一种用于视频中多人 2D 姿态估计的完全端到端框架,有效消除启发式操作。一个关键挑战是在复杂和重叠的时序轨迹下关联个体。为此,我们引入一种新的姿态感知视频变换器网络 (PAVE-Net),其包含用于建模帧内关系的空间编码器和用于捕获跨帧全局依赖关系的时空姿态解码器。为实现准确的时序关联,我们提出了一种姿态感知注意力机制,使每个姿态查询能够选择性地聚合来自连续帧中相同个体对应的特征。此外,我们显式建模姿态关键点之间的时空依赖关系以提高准确性。值得注意的是,我们的方法是首个用于多帧 2D 人类姿态估计的端到端方法。广泛的实验表明,PAVE-Net 在 PoseTrack2017 上显著优于先前基于图像的端到端方法,实现了 6.0 的 mAP 提升,同时在效率方面也提供了显著的提升。项目页面: https://github.com/zgspose/PAVENet。
引用
@article{arxiv.2511.13208,
title = {End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer},
author = {Yonghui Yu and Jiahang Cai and Xun Wang and Wenwu Yang},
journal= {arXiv preprint arXiv:2511.13208},
year = {2025}
}