用于基于骨架的动作识别的无监督时空特征增强与保真度保持网络
计算机视觉与模式识别
2024-01-26 v1
摘要
基于骨架的无监督动作识别近期取得了显著进展。现有的无监督学习方法存在严重的过拟合问题,因此只能使用小型网络,这显著降低了表征能力。为了解决这个问题,本文首先研究了基于骨架的动作识别中无监督学习背后的过拟合机制。观察到骨架本身已经是一个相对高层次且低维度的特征,但与用于动作识别的特征并不处于同一流形。简单地应用现有的无监督学习方法可能倾向于产生区分不同样本而非动作类别的特征,从而导致过拟合问题。为解决此问题,本文提出了一种无监督时空特征增强与保真度保持框架(U-FEFP),以生成包含骨架序列所有信息的丰富分布式特征。开发了一个时空特征变换子网络,使用时空图卷积网络和图卷积门控循环单元网络作为基础特征提取网络。采用基于无监督 Bootstrap Your Own Latent 的学习来生成丰富的分布式特征,并采用基于无监督前置任务的学习来保持骨架序列的信息。这两种无监督学习方式协同工作,构成 U-FEFP,以产生鲁棒且具有判别性的表征。在三个广泛使用的基准数据集(即 NTU-RGB+D-60、NTU-RGB+D-120 和 PKU-MMD 数据集)上的实验结果表明,与最先进的无监督学习方法相比,所提出的 U-FEFP 取得了最佳性能。t-SNE 图示进一步验证了 U-FEFP 可以为无监督的基于骨架的动作识别学习到更具判别性的特征。
引用
@article{arxiv.2401.14034,
title = {Unsupervised Spatial-Temporal Feature Enrichment and Fidelity Preservation Network for Skeleton based Action Recognition},
author = {Chuankun Li and Shuai Li and Yanbo Gao and Ping Chen and Jian Li and Wanqing Li},
journal= {arXiv preprint arXiv:2401.14034},
year = {2024}
}