SRF-Net:用于无锚框时序动作检测的选择感受野网络
计算机视觉与模式识别
2021-06-30 v1
摘要
时序动作检测(TAD)是一项具有挑战性的任务,旨在未修剪视频中时序定位并识别人体动作。当前主流的单阶段 TAD 方法依赖预定义锚框来定位与分类动作提议,其中动作实例的位置与尺度由设计者设定。显然,此类基于锚框的 TAD 方法限制了其泛化能力,并在视频包含丰富动作变化时导致性能下降。本研究探索去除 TAD 方法对预定义锚框的需求。我们提出了一种称为选择性感受野网络(SRF-Net)的新型 TAD 模型,其中每个时序位置处的位置偏移与分类分数可在特征图中直接估计,且 SRF-Net 以端到端方式训练。创新地,我们专门设计了一个称为选择性感受野卷积(SRFC)的构建模块,其能够根据特征图中每个时序位置处多尺度输入信息自适应调整感受野大小。在 THUMOS14 数据集上进行了大量实验,相较于最先进的 TAD 方法取得了更优结果。
引用
@article{arxiv.2106.15258,
title = {SRF-Net: Selective Receptive Field Network for Anchor-Free Temporal Action Detection},
author = {Ranyu Ning and Can Zhang and Yuexian Zou},
journal= {arXiv preprint arXiv:2106.15258},
year = {2021}
}
备注
Accepted by ICASSP 2021