基于解耦时空聚合的视频人体姿态回归
计算机视觉与模式识别
2024-04-02 v2
摘要
通过利用视频序列中的时间依赖性,多帧人体姿态估计算法在遮挡、运动模糊和视频散焦等复杂情况下取得了显著成果。这些算法主要基于热图,导致每帧的计算和存储需求很高,限制了其在视频场景中的灵活性和实时应用,尤其是在边缘设备上。本文提出了一种高效且有效的基于视频的人体姿态回归方法,该方法绕过热图等中间表示,直接将输入映射到输出关节坐标。尽管人体姿态的相邻关节之间存在固有的空间相关性,但每个独立关节的时间轨迹却表现出相对独立性。鉴于此,我们提出了一种新颖的解耦时空聚合网络(DSTA),分别捕捉相邻关节间的空间上下文和每个独立关节的时间线索,从而避免了时空维度的混淆。具体而言,DSTA 为每个关节学习一个专用的特征令牌,以促进其时空依赖关系的建模。借助所提出的关节级局部感知注意力机制,我们的方法能够高效且灵活地利用相邻关节的空间依赖性和每个关节自身的时间依赖性。大量实验证明了我们方法的优越性。与之前基于回归的单帧人体姿态估计方法相比,DSTA 显著提升了性能,在 PoseTrack2017 数据集上实现了 8.9 mAP 的提升。此外,我们的方法性能优于或持平于最先进的基于热图的多帧人体姿态估计方法。项目页面:https://github.com/zgspose/DSTA。
引用
@article{arxiv.2403.19926,
title = {Video-Based Human Pose Regression via Decoupled Space-Time Aggregation},
author = {Jijie He and Wenwu Yang},
journal= {arXiv preprint arXiv:2403.19926},
year = {2024}
}
备注
12 pages, 3 figures