ACSNet:用于弱监督时序动作定位的动作-上下文分离网络
计算机视觉与模式识别
2021-03-30 v1
摘要
弱监督时序动作定位(WS-TAL)的目标是在仅使用视频级监督的情况下,定位未修剪视频中的所有动作实例。由于训练期间缺乏帧级标注,当前 WS-TAL 方法依赖注意力机制来定位对视频级分类任务有贡献的前景片段或帧。该策略在定位结果中常将上下文与实际动作混淆。分离动作与上下文是精确 WS-TAL 的核心问题,但其极具挑战性且在文献中多被忽视。本文中,我们引入一种显式考虑上下文以实现精确动作定位的动作-上下文分离网络(ACSNet)。它由两个分支组成(即前景-背景分支与动作-上下文分支)。前景-背景分支首先从整个视频中区分前景与背景,而动作-上下文分支进一步将前景分离为动作与上下文。我们将视频片段与两个潜在分量(即正分量与负分量)相关联,它们的不同组合可有效刻画前景、动作与上下文。此外,我们引入带有辅助上下文类别的扩展标签以促进动作-上下文分离的学习。在 THUMOS14 与 ActivityNet v1.2/v1.3 数据集上的实验表明,ACSNet 大幅优于现有最优 WS-TAL 方法。
引用
@article{arxiv.2103.15088,
title = {ACSNet: Action-Context Separation Network for Weakly Supervised Temporal Action Localization},
author = {Ziyi Liu and Le Wang and Qilin Zhang and Wei Tang and Junsong Yuan and Nanning Zheng and Gang Hua},
journal= {arXiv preprint arXiv:2103.15088},
year = {2021}
}
备注
Accepted by the 35th AAAI Conference on Artificial Intelligence (AAAI 2021)