学习显著边界特征用于无锚框时序动作定位
计算机视觉与模式识别
2021-03-25 v1 人工智能
摘要
时序动作定位是视频理解中重要且具有挑战性的任务。通常,该任务旨在推断长而未裁剪视频中每个动作实例的类别及起止帧定位。尽管当前多数模型借助预定义锚框与大量动作性(actionness)取得了良好结果,此类方法却受困于海量输出以及对不同锚框位置与尺寸的大量调参。相比之下,无锚框方法更轻量、免去了冗余超参数,却鲜受关注。本文中,我们提出首个纯粹无锚框的时序定位方法,其兼具高效与有效。我们的模型包括:(i) 一个端到端可训练的基础预测器,(ii) 一个基于显著性的精炼模块,通过新颖的边界池化为每个候选段收集更有价值的边界特征,以及 (iii) 若干一致性约束,以确保模型在给定任意候选段时能找到准确边界。大量实验表明,我们的方法在THUMOS14上以显著优势超越所有基于锚框与动作性引导的方法,取得最先进结果,在ActivityNet v1.3上结果相当。代码见 https://github.com/TencentYoutuResearch/ActionDetection-AFSD。
引用
@article{arxiv.2103.13137,
title = {Learning Salient Boundary Feature for Anchor-free Temporal Action Localization},
author = {Chuming Lin and Chengming Xu and Donghao Luo and Yabiao Wang and Ying Tai and Chengjie Wang and Jilin Li and Feiyue Huang and Yanwei Fu},
journal= {arXiv preprint arXiv:2103.13137},
year = {2021}
}
备注
Accepted by CVPR2021