用于人体动作识别的语义图像网络
计算机视觉与模式识别
2019-10-25 v1
摘要
在本文中,我们提出使用语义图像——一种改进的视频分析表示,主要结合 Inception 网络使用。语义图像通过在近似秩池化之前应用基于全局聚类的局部稀疏分割(LSSGC)获得,该池化将运动特征总结于单幅或多幅图像中。它通过将从窗口得到的静态背景叠加到后续分割帧上来融入背景信息。其思想是聚焦于对动作识别重要的区域以改善动作-运动动态,并利用帧排序方法编码时间方差。我们还提出 Inception-ResNetv2 与长短期记忆网络(LSTM)的串行组合,以利用时间方差提升识别性能。我们在动作识别研究中广泛使用的 UCF101 和 HMDB51 数据集上进行了充分分析。我们表明:(i)语义图像比其原始变体产生更好的激活并更快收敛;(ii)在近似秩池化之前使用分割可取得更好的识别性能;(iii)LSTM 的使用利用了近似秩池化的时间方差信息,比基础网络更好地建模动作行为;(iv)所提表示具有适应性,可与时间分段网络等现有方法结合使用以提升识别性能;(v)我们提出的由语义图像与语义光流组成的四流网络架构取得了最先进的性能,在 UCF101 和 HMDB51 上的识别准确率分别为 95.9% 和 73.5%。
引用
@article{arxiv.1901.06792,
title = {Semantic Image Networks for Human Action Recognition},
author = {Sunder Ali Khowaja and Seok-Lyong Lee},
journal= {arXiv preprint arXiv:1901.06792},
year = {2019}
}
备注
30 pages