用于 RGB-D 动作识别的深度聚合网络协同训练
计算机视觉与模式识别
2018-01-04 v1
摘要
本文提出一种利用多异构源中联合信息的深度神经网络训练新范式。具体而言,在基于 RGB-D 的动作识别任务中,它在 RGB 视觉特征与深度特征上协同训练单一卷积神经网络(称为 c-ConvNet),并深度聚合这两类特征以进行动作识别。不同于常规 ConvNet 仅用单一 softmax 损失函数学习面向同构模态分类的深度可分特征,c-ConvNet 通过联合优化同构与异构模态的排序损失与 softmax 损失,增强深度习得特征的判别力并削弱不期望的模态差异。该排序损失由模态内与跨模态三元组损失构成,可减小模态内与跨模态的特征变异。此外,RGB 与深度数据间的相关性被嵌入 c-ConvNet,并可由任一模态检索,在即便仅有一类模态可用时亦有助于识别。所提方法在两个大型 RGB-D 动作识别数据集 ChaLearn LAP IsoGD 与 NTU RGB+D 以及一个小型数据集 SYSU 3D HOI 上进行了充分评估,取得了当前最优(state-of-the-art)结果。
引用
@article{arxiv.1801.01080,
title = {Cooperative Training of Deep Aggregation Networks for RGB-D Action Recognition},
author = {Pichao Wang and Wanqing Li and Jun Wan and Philip Ogunbona and Xinwang Liu},
journal= {arXiv preprint arXiv:1801.01080},
year = {2018}
}