中文

利用事件的视频级语义一致性进行视听事件定位

计算机视觉与模式识别 2024-02-07 v2 人工智能

摘要

视听事件(AVE)定位近年来引起了广泛关注。现有大多数方法通常局限于对从完整视频中分离出的每个视频片段进行独立编码和分类(可视为事件的片段级表示)。然而,它们忽略了同一完整视频内事件的语义一致性(可视为事件的视频级表示)。与现有方法不同,我们为 AVE 定位任务提出了一种新颖的视频级语义一致性引导网络。具体而言,我们提出了一个事件语义一致性建模(ESCM)模块,以探索视频级语义信息进行语义一致性建模。它由两个组件组成:跨模态事件表示提取器(CERE)和模态内语义一致性增强器(ISCE)。提出 CERE 以获取视频级别的事件语义信息。此外,ISCE 将视频级事件语义作为先验知识,引导模型关注每个模态内事件的语义连续性。此外,我们提出了一种新的负样本对过滤损失,以鼓励网络过滤掉不相关的片段对,并提出了一种新的平滑损失,以在弱监督设置下进一步增大不同类别事件之间的差距。我们在公开的 AVE 数据集上进行了大量实验,在完全监督和弱监督设置下均优于 SOTA 方法,从而验证了我们方法的有效性。代码可在 https://github.com/Bravo5542/VSCG 获取。

关键词

引用

@article{arxiv.2210.05242,
  title  = {Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization},
  author = {Yuanyuan Jiang and Jianqin Yin and Yonghao Dang},
  journal= {arXiv preprint arXiv:2210.05242},
  year   = {2024}
}

备注

13 pages, 10 figures, Accepted by IEEE Transactions on Multimedia