中文

CLIP-AE:用于无监督时序动作定位的 CLIP 辅助跨视角视听增强

计算机视觉与模式识别 2025-06-06 v2

摘要

时序动作定位(TAL)在信息检索领域引起了广泛关注。现有的有监督或弱监督方法严重依赖带标签的时序边界和动作类别,这既费时又费力。因此,无监督时序动作定位(UTAL)日益受到欢迎。然而,当前的方法面临两个主要挑战:1)分类预训练特征过度关注高判别性区域;2)仅依赖视觉模态信息难以确定上下文边界。为了解决这些问题,我们提出了一种 CLIP 辅助的跨视角视听增强 UTAL 方法。具体而言,我们引入视觉语言预训练(VLP)和基于分类预训练的协同增强,以避免过度关注高判别性区域;我们还结合了音频感知以提供更丰富的上下文边界信息。最后,我们引入自监督跨视角学习范式,在无需额外标注的情况下实现多视角感知增强。在两个公开数据集上的大量实验表明,我们的模型优于多个最先进的竞争方法。

关键词

引用

@article{arxiv.2505.23524,
  title  = {CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization},
  author = {Rui Xia and Dan Jiang and Quan Zhang and Ke Zhang and Chun Yuan},
  journal= {arXiv preprint arXiv:2505.23524},
  year   = {2025}
}