中文

基于类别语义的注意力机制用于动作检测

计算机视觉与模式识别 2021-09-07 v1

摘要

动作定位网络通常结构为一个特征编码器子网络和一个定位子网络,其中特征编码器学习将输入视频转换为对定位子网络生成可靠动作提议有用的特征。尽管某些编码特征可能对生成动作提议更有用,先前的动作定位方法未包含任何使定位子网络更关注更重要特征的注意力机制。本文中,我们提出一种新颖的注意力机制——基于类别语义的注意力(CSA),它从输入视频中存在的动作类别的语义时间分布学习,以找出编码特征的重要性分数,并用于对更有用的编码特征施加注意力。我们在两个流行动作检测数据集上证明,引入我们的新颖注意力机制在竞争性动作检测模型上带来可观性能提升(例如,相较 BMN 动作检测基线约 6.2% 的提升,在 THUMOS-14 数据集上获得 47.5% mAP),并在 ActivityNet v1.3 数据集上取得 36.25% mAP 的新最优结果。此外,包含 BMN-CSA 的 CSA 定位模型族是 2021 年 ActivityNet 动作定位挑战赛亚军提交方案的一部分。我们的注意力机制在动作检测任务上优于先前的自注意力模块(如 squeeze-and-excitation)。我们还观察到我们的注意力机制与此类自注意力模块互补,二者结合使用时可见性能提升。

关键词

引用

@article{arxiv.2109.02613,
  title  = {Class Semantics-based Attention for Action Detection},
  author = {Deepak Sridhar and Niamul Quader and Srikanth Muralidharan and Yaoxin Li and Peng Dai and Juwei Lu},
  journal= {arXiv preprint arXiv:2109.02613},
  year   = {2021}
}

备注

Accepted to ICCV 2021