基于对比学习的多模态人类活动识别:面对有限标注数据
机器学习
2026-04-28 v1 计算机视觉与模式识别
摘要
人类活动识别是各种新兴应用的基础。近年来,研究者们利用多源传感器进行协同感知,以捕获复杂且动态的人类活动。然而,多模态人类活动感知通常面临跨模态高度异构的数据以及标签稀缺的挑战,导致现有解决方案与实际需求之间存在应用鸿沟。本文提出了 CLMM(Contrastive Learning for Multimodal Human Activity Recognition),一个通用的对比学习框架,用于实现有限标注数据下的有效多模态识别。CLMM 采用新颖的两阶段训练策略。在第一个阶段,CLMM 使用 CNN-DiffTransformer 编码器通过提取局部和全局特征来捕获跨模态共享信息。同时,一种硬正样本加权算法增强了梯度传播,以强化共享学习。在第二个阶段,CLMM 采用融合质量导向注意力和双向门控单元的双支架架构捕获模态特定信息,同时采用主-辅助协作训练策略融合共享信息和模态特定信息。实验在三个公开数据集上表明,CLMM 在识别准确率和收敛性能方面均显著优于最新的基线方法。
引用
@article{arxiv.2604.23281,
title = {Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data},
author = {Long Jing and Zhixiong Yang and Yajun Zhang and Xinlong Feng},
journal= {arXiv preprint arXiv:2604.23281},
year = {2026}
}