中文

一种用于弱监督时序动作定位的混合注意力机制

计算机视觉与模式识别 2021-03-26 v3 人工智能

摘要

弱监督时序动作定位是一项具有挑战性的视觉任务,因为训练视频中缺乏动作的真实时间位置。在训练期间仅使用视频级监督,大多数现有方法依赖多示例学习(Multiple Instance Learning, MIL)框架来预测视频中每个动作类别的起始和结束帧。然而,现有的基于MIL的方法有一个主要局限,即仅捕获动作中最具判别性的帧,而忽略了活动的完整范围。此外,这些方法不能有效地建模背景活动,而背景活动在定位前景活动中起着重要作用。本文提出了一种名为HAM-Net的新框架,其具有包含时间软注意力、半软注意力和硬注意力的混合注意力机制,以解决这些问题。我们的时间软注意力模块由分类模块中的辅助背景类引导,通过为每个视频片段引入“动作性”(action-ness)分数来建模背景活动。此外,我们的时间半软和硬注意力模块为每个视频片段计算两个注意力分数,有助于聚焦于动作中判别性较弱的帧,从而捕获完整的动作边界。我们提出的方法在THUMOS14数据集上以IoU阈值0.5优于近期最先进(state-of-the-art, SOTA)方法至少2.2% mAP,在ActivityNet1.2数据集上以IoU阈值0.75优于至少1.3% mAP。代码见:https://github.com/asrafulashiq/hamnet。

关键词

引用

@article{arxiv.2101.00545,
  title  = {A Hybrid Attention Mechanism for Weakly-Supervised Temporal Action Localization},
  author = {Ashraful Islam and Chengjiang Long and Richard Radke},
  journal= {arXiv preprint arXiv:2101.00545},
  year   = {2021}
}

备注

Extended version/preprint of a AAAI 2021 paper