Fusion-GCN:基于图卷积网络的多模态动作识别
计算机视觉与模式识别
2021-09-28 v1
摘要
本文提出 Fusion-GCN,一种利用图卷积网络(GCNs)进行多模态动作识别的方法。基于 GCN 的动作识别方法近期在基于骨架的动作识别上取得了最先进的性能。通过 Fusion-GCN,我们提议将多种传感器数据模态整合到一个图中,并使用 GCN 模型进行训练以实现多模态动作识别。额外的传感器测量值被纳入图表示中,可以在通道维度(引入额外的节点属性)或空间维度(引入新节点)上实现。Fusion-GCN 在两个公开数据集 UTD-MHAD 和 MMACT 上进行了评估,展示了其对 RGB 序列、惯性测量和骨架序列的灵活融合能力。我们的方法在 UTD-MHAD 数据集上取得了可比的结果,并通过融合骨架估计与加速度计测量,在大规模 MMACT 数据集上将基线显著提升了最多 12.37%(F1 值)。
引用
@article{arxiv.2109.12946,
title = {Fusion-GCN: Multimodal Action Recognition using Graph Convolutional Networks},
author = {Michael Duhme and Raphael Memmesheimer and Dietrich Paulus},
journal= {arXiv preprint arXiv:2109.12946},
year = {2021}
}
备注
18 pages, 6 figures, 3 tables, GCPR 2021