基于骨架动作理解的统一多模态无监督表示学习
计算机视觉与模式识别
2023-11-07 v1
摘要
无监督预训练近年来在基于骨架的动作理解中取得了巨大成功。现有工作通常训练独立的模态特定模型,然后通过后期融合策略整合多模态信息用于动作理解。尽管这些方法已取得显著性能,但它们受限于复杂且冗余的多流模型设计,且每个流也仅限于固定的输入骨架模态。为缓解这些问题,本文提出一种称为UmURL的统一多模态无监督表示学习框架,其采用高效的早期融合策略以单流方式联合编码多模态特征。具体而言,不同于为单模态无监督学习设计独立的模态特定优化过程,我们将不同模态输入以早期融合策略送入同一流中以学习其多模态特征,从而降低模型复杂度。为确保融合后的多模态特征不表现出模态偏置(即不被某一模态输入主导),我们进一步提出模态内与模态间一致性学习,通过特征分解与差异化对齐保证多模态特征包含各模态的完整语义。如此,我们的框架能够学习单模态或多模态骨架输入的统一表示,可灵活适应不同模态输入以在实际场景中实现鲁棒的动作理解。在NTU-60、NTU-120和PKU-MMD II三个大规模数据集上的大量实验表明,UmURL高效且具备与单模态方法近似的复杂度,同时在基于骨架的动作表示学习的各类下游任务场景中达到新的SOTA性能。
引用
@article{arxiv.2311.03106,
title = {Unified Multi-modal Unsupervised Representation Learning for Skeleton-based Action Understanding},
author = {Shengkai Sun and Daizong Liu and Jianfeng Dong and Xiaoye Qu and Junyu Gao and Xun Yang and Xun Wang and Meng Wang},
journal= {arXiv preprint arXiv:2311.03106},
year = {2023}
}
备注
Accepted by ACM MM 2023. The code is available at https://github.com/HuiGuanLab/UmURL