通过显式学习动作与上下文子空间实现的弱监督时间动作定位
计算机视觉与模式识别
2021-03-31 v1
摘要
弱监督时间动作定位(WS-TAL)方法仅在视频级监督下学习定位视频中动作实例的时间起止点。现有 WS-TAL 方法依赖于为动作识别学习的深度特征。然而,由于分类与定位之间的不匹配,这些特征无法区分频繁共现的上下文背景(即上下文)与实际动作实例。我们将这一挑战称为动作-上下文混淆,它会 adversely 影响动作定位精度。为应对该挑战,我们引入了一个分别针对动作及其上下文学习两个特征子空间的框架。通过显式考虑动作视觉元素,可在不受上下文干扰的情况下更精确地定位动作实例。为仅利用视频级类别标签促进这两个特征子空间的学习,我们利用来自空间流与时间流的预测进行片段分组。此外,引入了一项无监督学习任务,使所提模块专注于挖掘时间信息。所提方法在 THUMOS14、ActivityNet v1.2 和 v1.3 三个基准数据集上优于当前最优的 WS-TAL 方法。
引用
@article{arxiv.2103.16155,
title = {Weakly Supervised Temporal Action Localization Through Learning Explicit Subspaces for Action and Context},
author = {Ziyi Liu and Le Wang and Wei Tang and Junsong Yuan and Nanning Zheng and Gang Hua},
journal= {arXiv preprint arXiv:2103.16155},
year = {2021}
}
备注
Accepted by the 35th AAAI Conference on Artificial Intelligence (AAAI 2021)