中文

基于CNN的步态识别中多模态特征融合:一项实证比较

计算机视觉与模式识别 2020-02-21 v2

摘要

基于行人行走方式(即步态)的视频人员识别是计算机视觉中一种非侵入式的相关任务。标准及当前方法通常从提取自图像的主体二值能量图序列中导出步态签名,但这一过程引入了大量的非平稳噪声,从而限制了其有效性。相比之下,本文关注原始像素或由其导出的简单函数,让先进的学习技术去提取相关特征。因此,我们针对两种广泛采用且具有挑战性的数据集TUM-GAID和CASIA-B,使用三种不同模态(即灰度像素、光流通道和深度图)对不同的卷积神经网络(CNN)架构进行了比较研究。此外,我们对用于组合每种模态所获信息的不同早期融合与晚期融合方法进行了比较研究。实验结果表明:(i)与传统的基于轮廓的最优特征(如GEI)相比,原始像素值是一种具有竞争力的输入模态,因为其取得了相当或更好的结果;(ii)将原始像素信息与光流和深度图信息相融合,可在步态识别任务上取得最优结果,且图像分辨率比先前报道的结果小数倍;(iii)CNN架构的选择与设计是关键点,可决定取得最优结果还是糟糕结果。

关键词

引用

@article{arxiv.1806.07753,
  title  = {Multimodal feature fusion for CNN-based gait recognition: an empirical comparison},
  author = {Francisco Manuel Castro and Manuel Jesús Marín-Jiménez and Nicolás Guil and Nicolás Pérez de la Blanca},
  journal= {arXiv preprint arXiv:1806.07753},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:1603.01006