中文

利用场景信息和多任务学习方法提升人-物互动动作识别

计算机视觉与模式识别 2025-09-18 v3

摘要

最近的图卷积神经网络(GCN)在使用人类骨架姿态的情况下显示出人类动作识别中的高性能,但由于缺乏有效的场景信息表示和合适的学习架构,未能成功检测人-物互动案例。在此背景下,我们提出一种方法论,利用固定物体信息来考虑人类动作识别性能,并遵循多任务学习方法。为评估所提方法,我们收集来自公开环境的真实数据并准备了数据集,其中包括手部操作固定物体(如 ATM 取票机、登机/退机机器等)的互动类别和行走和站立的非互动类别。多任务学习方法,结合互动区域信息,成功地以 99.25% 的准确率识别了研究的互动和非互动动作,显著优于仅使用人类骨架姿态的基准模型提升了 2.75% 的准确率。

关键词

引用

@article{arxiv.2509.09067,
  title  = {Improvement of Human-Object Interaction Action Recognition Using Scene Information and Multi-Task Learning Approach},
  author = {Hesham M. Shehata and Mohammad Abdolrahmani},
  journal= {arXiv preprint arXiv:2509.09067},
  year   = {2025}
}