中文

用于多模态人类活动识别的蒸馏中段融合 Transformer 网络

人机交互 2023-05-09 v1 计算机视觉与模式识别

摘要

人类活动识别在许多人机协作场景中是一项重要任务,同时具有多种实际应用。尽管单模态方法已被广泛研究,但它们受限于数据质量并需要特定模态的特征工程,因此在真实世界部署中不够鲁棒和有效。通过利用多种传感器,多模态人类活动识别可以利用互补信息构建具有良好泛化能力的模型。虽然深度学习方法已展现出有前景的结果,但其在提取显著多模态时空特征和更好融合互补信息方面的潜力尚未被充分挖掘。此外,降低多模态方法以实现边缘部署的复杂性是另一个尚待解决的问题。为解决这些问题,提出了一种基于知识蒸馏的多模态中段融合方法 DMFT,以进行有效信息特征提取与融合,从而高效解决多模态人类活动识别任务。DMFT 首先将多模态输入数据编码为统一表示。然后 DMFT 教师模型应用一个注意力多模态时空 transformer 模块来提取显著的时空特征。还提出了一种时间中段融合模块以进一步融合时间特征。随后应用知识蒸馏方法将学到的表示从教师模型迁移到一个更简单的 DMFT 学生模型,该学生模型由轻量版多模态时空 transformer 模块组成,以产生结果。在两个公开的多模态人类活动识别数据集上,使用多种最先进的方法对 DMFT 进行了评估。实验结果表明,该模型在有效性、可扩展性和鲁棒性方面取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2305.03810,
  title  = {Distilled Mid-Fusion Transformer Networks for Multi-Modal Human Activity Recognition},
  author = {Jingcheng Li and Lina Yao and Binghao Li and Claude Sammut},
  journal= {arXiv preprint arXiv:2305.03810},
  year   = {2023}
}

备注

13 pages, 6 figures