中文

UWAV:基于不确定性加权的弱监督音视频视频解析

计算机视觉与模式识别 2025-05-15 v1 声音 音频与语音处理

摘要

音视频视频解析(AVVP)涉及定位单模态事件(即仅在视频的视觉或声学模态中发生的事件)和多模态事件(即同时在两种模态中发生的事件)的任务。此外,对训练数据中所有这些事件类别标签以及其开始和结束时间进行标注的高昂成本,构成了AVVP技术在规模性方面的限制,除非它们能够在弱监督设置下进行训练,在这种设置下,训练数据中仅提供与模态无关的视频级别标签。为此,最近的研究方法寻求生成分段级别的伪标签以更好地指导模型训练。然而,缺乏分段之间相互依赖性的生成这些伪标签,以及对预测在某个分段中缺失标签的一般性偏见限制了其性能。本工作提出了一种克服这些弱点的新方法,称为不确定性加权的弱监督音视频视频解析(UWAV)。此外,我们创新的方法考虑到这些估计伪标签所涉及的不确定性,并采用基于特征混合的训练正则化以提高训练效果。实验结果表明,UWAV 在多个指标上超过了AVVP任务上的最新方法,跨越两个不同数据集,彰显了其有效性和通用性。

关键词

引用

@article{arxiv.2505.09615,
  title  = {UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing},
  author = {Yung-Hsuan Lai and Janek Ebbers and Yu-Chiang Frank Wang and François Germain and Michael Jeffrey Jones and Moitreya Chatterjee},
  journal= {arXiv preprint arXiv:2505.09615},
  year   = {2025}
}

备注

CVPR 2025