中文

MUG:伪标签增强的音视频Mamba网络用于音视频视频解析

计算机视觉与模式识别 2025-08-13 v2

摘要

弱监督音视频视频解析(AVVP)旨在预测所有模态特定事件并定位其时间边界。尽管取得了显著进展,但由于弱监督方法的局限性和模型架构的缺陷,现有方法在同时提高segment级别预测和event级别预测方面不足。本文提出了一种带伪标签aUGmentation(MUG)的音视频Mamba网络,以强调每个segment的独特性并排除交替模态的噪声干扰。具体而言,我们基于前一工作对一些伪标签进行注释。使用单模态伪标签,我们进行跨模态随机组合,以生成新数据,这可以增强模型解析各种segment级别事件组合的能力。对于特征处理和交互,我们采用音视频Mamba网络。AV-Mamba增强了对不同segment的感知能力,同时排除了额外模态的噪声,同时共享类似模态信息。我们的广泛实验表明,MUG在LLP数据集上在所有指标上实现了状态-of-the-art(SOTA)改进(例如,在视觉segment级别和音频segment级别指标上分别获得2.1%和1.2%的提升)。我们的代码可在https://github.com/WangLY136/MUG获取。

关键词

引用

@article{arxiv.2507.01384,
  title  = {MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing},
  author = {Langyu Wang and Bingke Zhu and Yingying Chen and Yiyuan Zhang and Ming Tang and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2507.01384},
  year   = {2025}
}

备注

Accpted by ICCV 2025