以3D人体姿态为基础的 grounding foundational vision models 以实现稳健的动作识别
计算机视觉与模式识别
2025-11-11 v1 人工智能
机器学习
机器人学
摘要
对于具身智能体有效地理解和与身边的世界互动,他们需要对人类动作在物理空间中的细致理解。当前的动作识别模型通常依赖 RGB 视频,学习模式与动作标签之间的浅层关联,因而难以捕捉复杂场景中人类姿态和底层物理交互动态。我们提出一种模型架构,将动作识别 grounded 在物理空间,通过融合两种强大且互补的表征:V-JEPA 2 的上下文、预测世界动态以及 CoMotion 的显式、具备遮挡容错性的人体姿态数据。我们的模型在 InHARD 和 UCF-19-Y-OCC 两个基准上进行验证,分别用于一般动作识别和高遮挡动作识别。我们的模型在三个基线模型中均表现出色,尤其在复杂遮挡场景中效果更为突出。我们的发现强调,动作识别需要受到空间理解的支持,而不仅仅是统计模式识别。
引用
@article{arxiv.2511.05622,
title = {Grounding Foundational Vision Models with 3D Human Poses for Robust Action Recognition},
author = {Nicholas Babey and Tiffany Gu and Yiheng Li and Cristian Meo and Kevin Zhu},
journal= {arXiv preprint arXiv:2511.05622},
year = {2025}
}
备注
Accepted at NeurIPS 2025 SpaVLE, for code see https://github.com/nbabey20/groundactrec , 9 pages, 1 figure