中文

用于时序动作定位的结构化注意力组合

计算机视觉与模式识别 2022-05-30 v2

摘要

时序动作定位旨在从未裁剪视频中定位动作实例。现有工作设计了各种有效模块,基于外观与运动特征来精确局部化动作实例。然而,由于以往工作对等对待这两类特征,无法充分利用各模态特征,使得所学模型仍非最优。为解决此问题,我们基于不同动作对外观或运动模态表现出特定偏好的观察,较早地从多模态特征学习视角研究时序动作定位。具体而言,我们构建了一种新颖的结构化注意力组合模块。与传统注意力不同,所提模块不会独立推断帧注意力与模态注意力,而是将模态注意力与帧注意力之间的关系视为注意力分配过程,借助最优传输理论,学习编码帧-模态结构,并分别用它来正则化推断出的帧注意力与模态注意力。最终的帧-模态注意力由这两个独立注意力组合得到。所提结构化注意力组合模块可作为即插即用模块部署到现有动作定位框架中。在两个广泛使用的基准上的大量实验表明,所提结构化注意力组合持续提升了四种最先进的时序动作定位方法,并在 THUMOS14 上取得了新的 SOTA 性能。代码见 https://github.com/VividLe/Structured-Attention-Composition。

关键词

引用

@article{arxiv.2205.09956,
  title  = {Structured Attention Composition for Temporal Action Localization},
  author = {Le Yang and Junwei Han and Tao Zhao and Nian Liu and Dingwen Zhang},
  journal= {arXiv preprint arXiv:2205.09956},
  year   = {2022}
}

备注

Accepted by T-IP