中文

基于特权信息的 RNN 学习与精炼及其在深度序列动作识别中的应用

计算机视觉与模式识别 2017-08-09 v4

摘要

现有的基于 RNN 的深度序列动作识别方法需要骨架关节点或手工设计的深度特征作为输入。设计从原始深度图到动作类别的端到端映射并非易事,原因在于:1)单通道图缺乏纹理,从而削弱了判别能力;2)深度训练数据集相对较小。为了应对这些挑战,我们提出分三步学习一个由特权信息(PI)驱动的 RNN:预训练一个编码器以学习深度外观与 PI(即骨架关节点)的联合嵌入。然后在学习步骤中微调所学习的嵌入层,旨在通过以多任务损失形式利用 PI 来优化网络。然而,由于两者之间的差距,将 PI 作为次要任务来利用对改善主任务(即分类)的性能帮助不大。最后,在精炼步骤中定义一个桥接矩阵,通过发现潜在 PI 来连接两个任务。我们基于 PI 的分类损失维持了潜在 PI 与预测分布之间的一致性。潜在 PI 和网络在期望最大化过程中进行迭代估计和更新。所提出的学习过程为建模微小的深度差异提供了更强的判别能力,同时有助于避免在稀缺训练数据上过拟合。我们的实验表明,在三个公开基准数据集和我们新收集的 Blanket 数据集上,相较于 SOTA 方法取得了显著的性能提升。

关键词

引用

@article{arxiv.1703.09625,
  title  = {Learning and Refining of Privileged Information-based RNNs for Action Recognition from Depth Sequences},
  author = {Zhiyuan Shi and Tae-Kyun Kim},
  journal= {arXiv preprint arXiv:1703.09625},
  year   = {2017}
}

备注

conference cvpr 2017