面向时序动作提案的多粒度生成器
计算机视觉与模式识别
2019-04-15 v2
摘要
时序动作提案生成是一项重要任务,旨在未剪辑视频中定位包含人类动作的视频片段。本文提出一种多粒度生成器(MGG),依托配备位置嵌入信息的视频视觉特征,从不同粒度视角执行时序动作提案。首先,我们提出使用双线性匹配模型来挖掘视频序列内丰富的局部信息。随后,将段提案生成器(SPP)与帧动作性生成器(FAP)两个组件结合,以两种不同粒度执行时序动作提案任务。SPP 以特征金字塔形式考虑整段视频,从粗粒度视角生成段提案;而 FAP 对每个视频帧进行更细粒度的动作性评估。我们提出的 MGG 可以端到端方式训练。通过利用细粒度帧动作性信息对段提案进行时间调整,MGG 在公开 THUMOS-14 与 ActivityNet-1.3 数据集上取得了优于 SOTA 方法的性能。此外,我们采用现有动作分类器对 MGG 生成的提案进行分类,相较于视频检测任务中的竞争方法取得了显著提升。
引用
@article{arxiv.1811.11524,
title = {Multi-granularity Generator for Temporal Action Proposal},
author = {Yuan Liu and Lin Ma and Yifeng Zhang and Wei Liu and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1811.11524},
year = {2019}
}
备注
Accepted to CVPR 2019