中文

以3D人体姿态为基础的 grounding foundational vision models 以实现稳健的动作识别

计算机视觉与模式识别 2025-11-11 v1 人工智能 机器学习 机器人学

摘要

对于具身智能体有效地理解和与身边的世界互动,他们需要对人类动作在物理空间中的细致理解。当前的动作识别模型通常依赖 RGB 视频,学习模式与动作标签之间的浅层关联,因而难以捕捉复杂场景中人类姿态和底层物理交互动态。我们提出一种模型架构,将动作识别 grounded 在物理空间,通过融合两种强大且互补的表征:V-JEPA 2 的上下文、预测世界动态以及 CoMotion 的显式、具备遮挡容错性的人体姿态数据。我们的模型在 InHARD 和 UCF-19-Y-OCC 两个基准上进行验证,分别用于一般动作识别和高遮挡动作识别。我们的模型在三个基线模型中均表现出色,尤其在复杂遮挡场景中效果更为突出。我们的发现强调,动作识别需要受到空间理解的支持,而不仅仅是统计模式识别。

关键词

引用

@article{arxiv.2511.05622,
  title  = {Grounding Foundational Vision Models with 3D Human Poses for Robust Action Recognition},
  author = {Nicholas Babey and Tiffany Gu and Yiheng Li and Cristian Meo and Kevin Zhu},
  journal= {arXiv preprint arXiv:2511.05622},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 SpaVLE, for code see https://github.com/nbabey20/groundactrec , 9 pages, 1 figure