中文

用于时序动作提议精炼的时间上下文聚合网络

计算机视觉与模式识别 2021-03-25 v1

摘要

时序动作提议生成旨在估计未修剪视频中动作的时间区间,这是视频理解领域中一项具有挑战性但重要的任务。由于缺少高效的时间建模与有效的边界上下文利用,现有方法生成的提议仍存在时间边界不准确以及用于检索的置信度较差的问题。本文中,我们提出时间上下文聚合网络(TCANet),通过“局部与全局”时间上下文聚合以及互补且渐进的边界精炼来生成高质量动作提议。具体而言,我们首先设计局部-全局时间编码器(LGTE),其采用通道分组策略高效编码“局部与全局”时间相互依赖关系。此外,提议的边界与内部上下文分别用于帧级与段级边界回归。时间边界回归器(TBR)被设计以端到端方式结合这两种回归粒度,通过渐进精炼实现提议的精确边界与可靠置信度。我们在三个具挑战性数据集 HACS、ActivityNet-v1.3 和 THUMOS-14 上进行了大量实验,TCANet 可生成具有高精度与高召回率的提议。结合现有动作分类器,TCANet 相较于其他方法可获得显著的时序动作检测性能。毫不意外,所提 TCANet 在 CVPR 2020 - HACS 挑战赛时序动作定位任务排行榜上获得第 1 名。

关键词

引用

@article{arxiv.2103.13141,
  title  = {Temporal Context Aggregation Network for Temporal Action Proposal Refinement},
  author = {Zhiwu Qing and Haisheng Su and Weihao Gan and Dongliang Wang and Wei Wu and Xiang Wang and Yu Qiao and Junjie Yan and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2103.13141},
  year   = {2021}
}

备注

Accepted by CVPR2021