VideoCapsuleNet:一种用于动作检测的简化网络
计算机视觉与模式识别
2018-05-22 v1
摘要
深度卷积神经网络(DCNNs)的最新进展在视频人体动作分类上展示了极好的结果,然而动作检测仍是一个具有挑战性的问题。当前的动作检测方法遵循复杂的流程,涉及多个任务,如管提议(tube proposals)、光流和管分类。在本工作中,我们基于最近开发的胶囊网络提出了一种更优雅的动作检测解决方案。我们提出了一种用于视频的3D胶囊网络,称为VideoCapsuleNet:一种用于动作检测的统一网络,可联合执行逐像素动作分割与动作分类。所提出的网络是胶囊网络从2D到3D的推广,其将视频帧序列作为输入。3D推广急剧增加了网络中的胶囊数量,使得胶囊路由在计算上代价高昂。我们在卷积胶囊层中引入胶囊池化以解决此问题,使投票算法易于处理。网络中的协议路由(routing-by-agreement)固有地建模了动作表示,并且各种动作特征由预测的胶囊捕获。这启发我们利用胶囊进行动作定位,网络预测的类特定胶囊被用于确定动作的逐像素定位。该定位通过带卷积胶囊层的参数化跳跃连接得到进一步改善,并且网络以分类损失与定位损失端到端训练。所提出的网络在多个动作检测数据集上取得了最先进的性能,包括UCF-Sports、J-HMDB和UCF-101(24类),在v-mAP分数上相对于UCF-101有约20%的提升,相对于J-HMDB有约15%的提升。
引用
@article{arxiv.1805.08162,
title = {VideoCapsuleNet: A Simplified Network for Action Detection},
author = {Kevin Duarte and Yogesh S Rawat and Mubarak Shah},
journal= {arXiv preprint arXiv:1805.08162},
year = {2018}
}