中文

CoLeaF:面向弱监督音视频视频解析的对比式协作学习框架

计算机视觉与模式识别 2024-07-16 v4

摘要

弱监督音视频视频解析(AVVP)方法旨在仅使用视频级标签检测听觉-only、视觉-only和听觉-可见事件。现有方法通过利用单模态和跨模态上下文来实现此目标。然而,我们认为在弱监督场景下,虽然跨模态学习有助于检测听觉-可见事件,但会对非对齐的听觉或视觉事件产生负面影响,引入不相关的模态信息。在本文中,我们提出CoLeaF,一种新型学习框架,优化了嵌入空间中跨模态上下文的集成,使网络能够显式地为听觉-可见事件学习跨模态信息的组合,同时过滤非对齐事件中的跨模态信息。此外,由于视频常涉及复杂的类关系,建模可提升性能,但会增加网络的计算成本。我们的框架在训练期间利用跨类关系,而无需在推理时增加额外计算。进一步,我们提出新的指标以更好地评估方法在执行AVVP方面的能力。我们的广泛实验表明,CoLeaF在LLP和UnAV-100数据集上分别将SOTA结果平均提高1.9%和2.4% F值。

关键词

引用

@article{arxiv.2405.10690,
  title  = {CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing},
  author = {Faegheh Sardari and Armin Mustafa and Philip J. B. Jackson and Adrian Hilton},
  journal= {arXiv preprint arXiv:2405.10690},
  year   = {2024}
}

备注

Accepted at ECCV 2024