中文

利用Transformer进行无约束视频中的弱监督目标定位

计算机视觉与模式识别 2024-07-09 v1 机器学习

摘要

弱监督视频目标定位(WSVOL)涉及仅使用视频级标签(也称为标记)来定位视频中的物体。最先进的WSVOL方法,如Temporal CAM (TCAM),依赖于类激活映射(CAM)并且通常需要一个预训练的CNN分类器。然而,它们的定位精度受到其倾向于最小化类内不同实例之间的互信息以及在训练期间利用时间信息进行下游任务(例如,检测和跟踪)的影响。在没有边界框标注的情况下,从时间线索中利用关于物体的精确信息是具有挑战性的,因为模型难以随时间定位物体。为了解决这些问题,提出了一种称为基于Transformer的视频CAM(TrCAM-V)的新方法用于WSVOL。它由一个DeiT骨干网络和两个用于分类和定位的头组成。分类头使用标准分类损失(CL)进行训练,而定位头则使用从预训练CLIP模型中提取的伪标签进行训练。从这些伪标签中,高激活值和低激活值分别被视为前景和背景区域。我们的TrCAM-V方法允许通过从这些区域即时采样伪像素来训练定位网络。此外,采用条件随机场(CRF)损失来将物体边界与前景图对齐。在推理过程中,该模型可以处理单个帧以实现实时定位应用。在具有挑战性的YouTube-Objects无约束视频数据集上进行的大量实验表明,我们的TrCAM-V方法在分类和定位精度方面达到了新的最先进性能。

关键词

引用

@article{arxiv.2407.06018,
  title  = {Leveraging Transformers for Weakly Supervised Object Localization in Unconstrained Videos},
  author = {Shakeeb Murtaza and Marco Pedersoli and Aydin Sarraf and Eric Granger},
  journal= {arXiv preprint arXiv:2407.06018},
  year   = {2024}
}