利用时空建模与多模态融合进行人体动作识别
计算机视觉与模式识别
2018-06-28 v1
摘要
本报告详细描述了我们解决 ActivityNet 2018 Kinetics-600 挑战赛任务的方法。尽管现有最优方法中已提出采用端到端框架(如 I3D \cite{i3d})或两阶段框架(即 CNN+RNN)的时空建模方法,但视频建模远未得到很好解决。在本挑战赛中,我们提出时空网络(StNet)以更好地联合时空建模并全面理解视频。此外,鉴于视频源中包含多模态信息,我们通过提出的改进时序 Xception 网络(iTXN)整合多模态信息的早期融合与后期融合策略用于视频理解。我们的 StNet RGB 单模型在 Kinetics-600 验证集上达到 78.99% 的 top-1 精度,而整合 RGB、光流和音频模态的改进时序 Xception 网络精度高达 82.35%。经模型集成后,我们在验证集上取得高达 85.0% 的 top-1 精度,并在所有提交结果中排名第一。
引用
@article{arxiv.1806.10319,
title = {Exploiting Spatial-Temporal Modelling and Multi-Modal Fusion for Human Action Recognition},
author = {Dongliang He and Fu Li and Qijie Zhao and Xiang Long and Yi Fu and Shilei Wen},
journal= {arXiv preprint arXiv:1806.10319},
year = {2018}
}