ACM-Net:面向弱监督时序动作定位的动作上下文建模网络
计算机视觉与模式识别
2021-04-08 v1 多媒体
摘要
弱监督时序动作定位旨在仅利用视频级标签来定位动作实例的时间边界并识别相应动作类别。传统方法主要聚焦于利用单一注意力分支与类激活序列分离前景与背景帧。然而,我们认为除具有区分性的前景与背景帧外,还存在大量语义模糊的动作上下文帧。将这些上下文帧归为同一背景类并不合理,因为它们在语义上与特定动作类别相关。因此,仅用单一类激活序列抑制动作上下文帧颇具挑战。为解决此问题,本文提出一种称为 ACM-Net 的动作上下文建模网络,其集成三分支注意力模块,同时度量每个时间点为动作实例、上下文或非动作背景的可能性。然后基于所得三分支注意力值,我们分别构建三分支类激活序列以表示动作实例、上下文与非动作背景。为评估 ACM-Net 的有效性,我们在 THUMOS-14 与 ActivityNet-1.3 两个基准数据集上进行了大量实验。实验表明,我们的方法优于当前最优方法,甚至可与全监督方法取得相当的性能。代码见 https://github.com/ispc-lab/ACM-Net
引用
@article{arxiv.2104.02967,
title = {ACM-Net: Action Context Modeling Network for Weakly-Supervised Temporal Action Localization},
author = {Sanqing Qu and Guang Chen and Zhijun Li and Lijun Zhang and Fan Lu and Alois Knoll},
journal= {arXiv preprint arXiv:2104.02967},
year = {2021}
}
备注
Submitted to TIP. Code is available at https://github.com/ispc-lab/ACM-Net