尺度至关重要:用于未裁剪视频中精确动作定位的时间尺度聚合网络
计算机视觉与模式识别
2019-08-05 v1
摘要
时间动作定位是近年来兴起的一项任务,旨在从未裁剪视频中定位包含特定动作的视频片段。尽管近期取得了显著进展,大多数两阶段动作定位方法仍受限于动作候选时序边界不精确的问题。本文提出一种新颖的集成式时间尺度聚合网络(TSA-Net)。我们的核心见解是,集成具有不同膨胀率的卷积滤波器能以较低计算成本有效扩大感受野,这启发我们设计多膨胀时间卷积(MDC)块。此外,为处理具有不同时长的视频动作实例,TSA-Net 由多个子网络分支组成。每个分支采用具有不同膨胀参数的堆叠 MDC 块,实现专门针对特定时长动作优化的时间感受野。我们遵循边界点检测的框架,新颖地检测三类关键点(即起始/中点/结束点)并将其配对以生成候选。我们在两个具有挑战性的视频基准 THUMOS14 和 ActivityNet-1.3 上进行了综合评估。我们提出的 TSA-Net 展现出清晰且持续更优的性能,并在两个基准上重新校准了新的 SOTA。例如,我们在 THUMOS14 上的新纪录为 46.9%,而此前最佳在 [email protected] 下为 42.8%。
引用
@article{arxiv.1908.00707,
title = {Scale Matters: Temporal Scale Aggregation Network for Precise Action Localization in Untrimmed Videos},
author = {Guoqiang Gong and Liangfeng Zheng and Kun Bai and Yadong Mu},
journal= {arXiv preprint arXiv:1908.00707},
year = {2019}
}