基于语言监督的人类动作识别 LS-HAR:以显著性融合和施工现场为用例
计算机视觉与模式识别
2025-03-06 v2 机器人学
摘要
检测人类动作是自动化机器人和车辆中的关键任务,常需集成多种数据模态以提高准确性。本研究介绍一种基于骨架和视觉线索的语言监督人类动作识别(HAR)方法,称为 LS-HAR。我们的方法利用语言模型引导骨架编码器的特征提取过程。具体而言,我们使用可学习的提示符(learnable prompts)来引导语言模型,条件化于骨架模态,以优化特征表示。此外,我们提出一种融合机制,将双模态特征通过显著性融合模块进行整合,融合过程中引入注意力机制和变换器机制,以解决多模态特征的高维问题。该融合过程优先选择信息丰富的视频帧和身体关节,从而增强对人类动作的识别准确性。此外,我们引入一个专为真实世界机器人应用在施工现场设计的新数据集,包含视觉、骨架和深度数据模态,命名为 VolvoConstAct。该数据集旨在促进机器学习模型的训练和评估,以指挥自动化施工机器人在实际施工现场执行必要任务。为评估我们的方法,我们在该数据集上以及三个广泛使用的公开数据集(NTU-RGB+D、NTU-RGB+D 120、NW-UCLA)上进行实验。结果表明,我们提出的方法在所有数据集上均实现了令人瞩目的性能,显示其鲁棒性及其在各种应用中的潜力。代码、数据集以及真实机器实验演示均可在 https://mmahdavian.github.io/ls_har/ 查阅。
引用
@article{arxiv.2410.01962,
title = {LS-HAR: Language Supervised Human Action Recognition with Salient Fusion, Construction Sites as a Use-Case},
author = {Mohammad Mahdavian and Mohammad Loni and Ted Samuelsson and Mo Chen},
journal= {arXiv preprint arXiv:2410.01962},
year = {2025}
}