YoTube:通过循环与静态回归网络搜索动作提案
计算机视觉与模式识别
2018-04-04 v1
摘要
本文提出YoTube——一种用于在未修剪视频中搜索动作提案的新型网络融合框架,其中每个动作提案对应于一个可能定位一个人动作的时空视频管。我们的方法由一个循环YoTube检测器和一个静态YoTube检测器组成,其中循环YoTube利用RNN的回归能力,基于学习到的时序动态预测候选边界框,而静态YoTube利用单帧中丰富的外观线索产生边界框。两个网络均使用rgb与光流进行训练,以充分挖掘丰富的外观、运动与时序上下文,其输出被融合以产生准确且鲁棒的提案框。动作提案最终通过动态规划并采用一种新颖的修剪方法链接这些框来构建,从而有效且高效地处理未修剪视频。在具有挑战性的UCF-101与UCF-Sports数据集上的大量实验表明,我们提出的技术相比最先进的获得了更优性能。
引用
@article{arxiv.1706.08218,
title = {YoTube: Searching Action Proposal via Recurrent and Static Regression Networks},
author = {Hongyuan Zhu and Romain Vial and Shijian Lu and Yonghong Tian and Xianbin Cao},
journal= {arXiv preprint arXiv:1706.08218},
year = {2018}
}