基于三维卷积神经网络的红外动作识别时空特征学习
计算机视觉与模式识别
2017-05-19 v1 人工智能
机器学习
多媒体
摘要
由于对光照条件和外观变化的敏感度较低,与可见光相机相比,红外成像有望实现更鲁棒的动作识别系统。尽管基于可见光成像采集的视频上的动作识别任务受到了广泛关注,但红外视频中的动作识别却鲜有探索。我们的目标是利用该模态的成像数据来完成动作识别任务。本文通过引入判别编码层及相应的判别编码损失函数,提出了一种新颖的双流三维卷积神经网络(CNN)架构。所提出的网络处理红外图像及基于红外的光流场序列。我们在可见光 Sports-1M 动作数据集上预训练 3D CNN 模型,并在红外动作识别数据集上对其进行微调。据我们所知,这是 3D CNN 在红外领域动作识别中的首次应用。我们对应用于不同 3D CNN 输出的不同融合方案(加权平均、单层和双层神经网络)进行了详尽分析。实验结果表明,我们的方法在 InfAR 数据集上能够达到当前最优的平均精度(AP)性能:(1) 所提出的双流 3D CNN 取得了已报道的最佳 77.5% AP,(2) 我们应用于光流场的 3D CNN 模型取得了已报道的最佳单流 75.42% AP。
引用
@article{arxiv.1705.06709,
title = {Learning Spatiotemporal Features for Infrared Action Recognition with 3D Convolutional Neural Networks},
author = {Zhuolin Jiang and Viktor Rozgic and Sancar Adali},
journal= {arXiv preprint arXiv:1705.06709},
year = {2017}
}