中文

CoLo-CAM:面向弱标签无约束视频中目标共定位的类激活映射

计算机视觉与模式识别 2025-01-28 v5

摘要

利用视频中的时空信息对于弱监督视频目标定位(WSVOL)任务至关重要。然而,最先进的方法仅依赖视觉与运动线索,却丢弃判别性信息,使其易于出现不准确的定位。近来,判别模型已通过时间类激活映射(CAM)方法被探索用于WSVOL任务。尽管其结果令人鼓舞,但该方法假设目标在帧间运动有限,导致在较长时序依赖下性能退化。本文提出一种用于WSVOL的新型CAM方法,在训练期间利用激活图中的时空信息,且不约束目标位置。其训练依赖于共定位(Co-Localization),故命名为CoLo-CAM。给定一帧序列,基于跨对应图提取的颜色线索联合学习定位,假设目标在连续帧中具有相似颜色。CAM激活被约束为对具有相似颜色的像素产生相似响应,从而实现共定位。这提升了定位性能,因为联合学习在所有图像位置与所有帧的像素间建立直接通信,允许定位的传递、聚合与修正。共定位通过最小化序列帧/CAM的条件随机场(CRF)损失中的颜色项被集成到训练中。在两个具有挑战性的无约束视频YouTube-Objects数据集上的大量实验显示了我们方法的优势,及其对长时序依赖的鲁棒性,从而取得了WSVOL任务的新最先进性能。

关键词

引用

@article{arxiv.2303.09044,
  title  = {CoLo-CAM: Class Activation Mapping for Object Co-Localization in Weakly-Labeled Unconstrained Videos},
  author = {Soufiane Belharbi and Shakeeb Murtaza and Marco Pedersoli and Ismail Ben Ayed and Luke McCaffrey and Eric Granger},
  journal= {arXiv preprint arXiv:2303.09044},
  year   = {2025}
}

备注

21 pages, 8 figures, Pattern Recognition 2025, https://doi.org/10.1016/j.patcog.2025.111358, CC-BY-NC-ND license