中文

学习语义动态和时空协作用于视频中的人体姿态估计

计算机视觉与模式识别 2025-02-18 v1

摘要

时序建模和时空协作是视频-based 人体姿态估计的关键技术。大多数先进方法采用光流或时序差分,在像素级别捕捉帧之间局部视觉内容对应关系,以捕获运动动态。然而,这种范式本质上依赖于局部像素到像素的相似性,忽略了帧之间的语义相关性,且对图像质量退化(如遮挡或模糊)敏感。此外,现有方法通常通过简单拼接或求和将运动和空间 (外观) 特征组合在一起,导致实际上难以充分利用这些不同模式。本文提出一种学习多层语义动态和密集时空协作的新型框架,用于多帧人体姿态估计。具体而言,我们首先设计了使用多掩码上下文和姿态重建策略的多层语义运动编码器。该策略促进模型探索帧之间多粒度时空语义关系,通过逐层掩码 (patch) 立方体和帧的特征。我们进一步引入空间-运动相互学习模块,以密集地传播和整合空间和运动特征,以增强模型的能力。广泛的实验表明,我们的方法在三个基准数据集上实现了新的最佳结果:PoseTrack2017、PoseTrack2018 和 PoseTrack21。

关键词

引用

@article{arxiv.2502.10616,
  title  = {Learning semantical dynamics and spatiotemporal collaboration for human pose estimation in video},
  author = {Runyang Feng and Haoming Chen},
  journal= {arXiv preprint arXiv:2502.10616},
  year   = {2025}
}