基于多阶段的多模态数据特征融合用于人类活动识别
计算机视觉与模式识别
2022-11-09 v1
摘要
为恰当满足人类需求,人类活动识别(HAR)系统需要具备融合来自多模态信息的能力。我们的假设是,多模态传感器、视觉与非视觉倾向于提供互补信息,从而解决其他模态的局限性。本工作中,我们提出一个多模态框架,学习有效结合来自RGB视频与IMU传感器的特征,并展示其在MMAct与UTD-MHAD数据集上的鲁棒性。我们的模型以两阶段训练:第一阶段每个输入编码器学习有效提取特征,第二阶段学习组合这些独立特征。相较于UTD-MHAD数据集上仅视频与仅IMU的设置,我们展示了22%与11%的显著提升,在MMAct数据集上则为20%与12%。通过大量实验,我们展示了模型在零样本设定与有限标注数据设定下的鲁棒性。我们进一步与使用更多输入模态的SOTA方法比较,表明我们的方法在更困难的MMact数据集上显著优于前者,在UTD-MHAD数据集上表现相当。
引用
@article{arxiv.2211.04331,
title = {Multi-Stage Based Feature Fusion of Multi-Modal Data for Human Activity Recognition},
author = {Hyeongju Choi and Apoorva Beedu and Harish Haresamudram and Irfan Essa},
journal= {arXiv preprint arXiv:2211.04331},
year = {2022}
}