ASM-Loc:面向弱监督时序动作定位的动作感知片段建模
计算机视觉与模式识别
2022-03-30 v1
摘要
弱监督时序动作定位旨在仅利用视频级动作标签进行训练,在未裁剪视频中识别并定位动作片段。由于缺乏动作片段的边界信息,现有方法大多依赖多示例学习(MIL),其中未标注示例(即视频片段)的预测通过分类已标注包(即未裁剪视频)来监督。然而,该形式通常将视频中的片段视为独立示例,忽略了动作片段内部及之间的潜在时间结构。为解决这个问题,我们提出 \system,一种新颖的 WTAL 框架,可实现超越标准基于 MIL 方法的显式、动作感知片段建模。我们的框架包含三个以片段为核心的组件:(i)动态片段采样,以补偿短动作的贡献;(ii)片段内与片段间注意力,用于建模动作动态并捕捉时间依赖;(iii)伪示例级监督,用于改进动作边界预测。此外,提出一种多步精炼策略,沿模型训练过程逐步改进动作提议。在 THUMOS-14 与 ActivityNet-v1.3 上的大量实验证明了我们方法的有效性,并在两个数据集上确立了新的 state of the art。代码与模型公开于~\url{https://github.com/boheumd/ASM-Loc}。
引用
@article{arxiv.2203.15187,
title = {ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action Localization},
author = {Bo He and Xitong Yang and Le Kang and Zhiyu Cheng and Xin Zhou and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2203.15187},
year = {2022}
}
备注
Accepted at CVPR 2022