面向多模态人体动作识别的统一对比融合 Transformer
计算机视觉与模式识别
2023-09-12 v1
摘要
人们已考虑使用各类传感器来开发人体动作识别(HAR)模型。通过融合不同传感器获取的多模态数据,可实现稳健的 HAR 性能。本文中,我们引入一种称为统一对比融合 Transformer(UCFFormer)的新型多模态融合架构,旨在整合具有不同分布的数据以提升 HAR 性能。基于从各模态提取的嵌入特征,UCFFormer 采用统一 Transformer 来捕获时间和模态域中嵌入之间的相互依赖关系。我们提出分解式时间-模态注意力,以高效地为统一 Transformer 执行自注意力。UCFFormer 还结合对比学习来减小各模态间特征分布的差异,从而生成语义对齐的特征用于信息融合。在两个流行数据集 UTD-MHAD 和 NTU RGB+D 上的性能评估表明,UCFFormer 取得了最先进的性能,以显著优势超越竞争方法。
引用
@article{arxiv.2309.05032,
title = {Unified Contrastive Fusion Transformer for Multimodal Human Action Recognition},
author = {Kyoung Ok Yang and Junho Koh and Jun Won Choi},
journal= {arXiv preprint arXiv:2309.05032},
year = {2023}
}