中文

TCAM:用于弱标签无约束视频中目标定位的时间类激活图

计算机视觉与模式识别 2022-10-25 v2

摘要

弱监督视频目标定位(WSVOL)仅利用如目标类别等全局视频标签即可在视频中定位目标。最先进的方法依赖多个独立阶段,其中利用视觉与运动线索生成初始时空候选区域,然后识别并细化显著目标。定位通过在一个或多个视频上求解优化问题完成,且视频标签通常用于视频聚类。这需要每个视频或每类一个模型,导致推理代价高昂。此外,由于无监督运动方法(如光流)或视频标签被排除在优化之外,定位区域未必具有判别性。本文中,我们利用为基于静态图像的WSOL设计的成功的类激活映射(CAM)方法。引入一种新的时间类激活图(TCAM)方法,训练一个判别性深度学习(DL)模型,通过称为CAM-时间最大池化(CAM-TMP)的聚合机制在连续CAM上利用视频中的时空信息。特别地,从预训练CNN分类器产生的CAM中收集感兴趣区域(ROIs)的激活,以构建像素级伪标签来训练DL模型。此外,使用全局无监督尺寸约束和局部约束(如CRF)以产生更准确的CAM。在独立单帧上的推理允许对一簇帧进行并行处理,并实现实时定位。在两个具有挑战性的无约束视频YouTube-Objects数据集上的大量实验表明,CAM方法(在独立帧上训练)可取得不错的定位精度。我们提出的TCAM方法在WSVOL精度上达到了新的state-of-art,且可视化结果表明其可适用于后续任务如视觉目标跟踪与检测。代码已公开。

关键词

引用

@article{arxiv.2208.14542,
  title  = {TCAM: Temporal Class Activation Maps for Object Localization in Weakly-Labeled Unconstrained Videos},
  author = {Soufiane Belharbi and Ismail Ben Ayed and Luke McCaffrey and Eric Granger},
  journal= {arXiv preprint arXiv:2208.14542},
  year   = {2022}
}

备注

13 pages, 7 figures