用于增强动作识别的三流网络
计算机视觉与模式识别
2021-06-25 v2
摘要
获取关于人类行为的准确信息是机器智能中最重要的任务之一。旨在从视频中理解人类活动的人的活动识别(Human Activity Recognition)由于包括背景、相机运动和数据集差异在内的多种问题而是一项具有挑战性的任务。本文提出了两种基于 CNN 的三流架构,使模型能够在不同设置下利用数据集。三条通路以帧率相区分。单通路以单一帧率运行捕获空间信息,慢速通路以低帧率运行捕获空间信息,快速通路以高帧率运行捕获精细的时间信息。在 CNN 编码器之后,我们分别添加双向 LSTM 和注意力头以捕获上下文和时间特征。通过在 UCF-101、Kinetics-600 和 AVA 数据集上对各种算法进行实验,我们观察到所提出的模型在人体动作识别任务上取得了最先进的性能。
引用
@article{arxiv.2104.13051,
title = {Three-stream network for enriched Action Recognition},
author = {Ivaxi Sheth},
journal= {arXiv preprint arXiv:2104.13051},
year = {2021}
}
备注
CVPR 2021 workshop