基于背景建模的弱监督动作定位
计算机视觉与模式识别
2019-08-20 v1
摘要
我们描述了一种潜在方法,其在仅给定整段视频类别标签的训练视频下,学习在长序列中检测动作。我们的方法在弱监督学习的注意力建模上使用了两项创新。首先,也是最显著地,我们的框架利用注意力模型提取前景与背景帧,并显式建模其外观。多数先前工作忽略背景,但我们表明建模背景可使系统学到更丰富的动作概念及其时间范围。其次,我们将自底向上的类不可知注意力模块与自顶向下的类特定激活图相结合,以后者作为前者的一种自监督形式。如此可使模型在无显式时间监督下学到更准确的注意力模型。这些改进在THUMOS14上相较现有系统取得10% AP@IoU=0.5的提升。我们提出的弱监督系统以至少4.3% AP@IoU=0.5优于近期最优方法。最后,我们展示了弱监督学习可用于激进地扩展至真实、未筛选的Instagram视频上的学习。这些视频的加入显著提升了我们弱监督模型的定位性能。
引用
@article{arxiv.1908.06552,
title = {Weakly-supervised Action Localization with Background Modeling},
author = {Phuc Xuan Nguyen and Deva Ramanan and Charless C. Fowlkes},
journal= {arXiv preprint arXiv:1908.06552},
year = {2019}
}
备注
To appear at ICCV 2019