基于生成式注意力建模的弱监督动作定位
计算机视觉与模式识别
2020-03-31 v2
摘要
弱监督时间动作定位是一类仅利用视频级动作标签来学习动作定位模型的问题。通用框架很大程度上依赖于分类激活,其采用注意力模型识别与动作相关的帧并将其分类至不同类别。此类方法导致动作-上下文混淆问题:由于靠近动作片段的上下文帧与特定类别密切相关,它们往往被误识别为动作帧本身。为解决该问题,本文提出利用条件变分自编码器(VAE)对基于帧注意力的类无关逐帧概率进行建模。鉴于上下文在表征层面上与动作存在显著差异,我们学习一个概率模型即条件VAE来建模给定注意力下每帧的似然。通过最大化相对于注意力的条件概率,动作帧与非动作帧得以良好分离。在THUMOS14与ActivityNet1.2上的实验证明了本方法的优势及在处理动作-上下文混淆问题上的有效性。代码现已发布于GitHub。
引用
@article{arxiv.2003.12424,
title = {Weakly-Supervised Action Localization by Generative Attention Modeling},
author = {Baifeng Shi and Qi Dai and Yadong Mu and Jingdong Wang},
journal= {arXiv preprint arXiv:2003.12424},
year = {2020}
}
备注
CVPR2020. Code is available at https://github.com/bfshi/DGAM-Weakly-Supervised-Action-Localization