中文

模态无关教师遇见弱监督音视频事件解析器

计算机视觉与模式识别 2023-10-03 v2 声音 音频与语音处理

摘要

音视频学习是多模态机器学习的重要支柱,学界多聚焦于其模态对齐设定,即假设音频与视觉模态均指向预测目标。借助 Look, Listen, and Parse 数据集(LLP),我们研究鲜有探索的非对齐设定:目标是在仅观测到弱标签的视频中识别音频与视觉事件。此类弱视频级标签仅告知发生了哪些事件,却不指明感知这些事件的模态(音频、视觉或两者皆有)。为强化该困难设定下的学习,我们引入大规模对比预训练模型作为模态教师。我们提出一种简洁、有效且通用的名为视觉-音频标签细化(VALOR)的方法,为训练事件挖掘模态标签。实证研究表明,挖掘出的标签使一个注意力基线在平均 F 值(Type@AV)上提升 8.0。令人惊讶的是,我们发现模态无关教师优于其模态融合的对应者,因为它们不受另一潜在非对齐模态的噪声干扰。此外,我们的最佳模型在 LLP 的全部指标上均以显著优势(+5.4 F 值 for Type@AV)达到新的 SOTA。VALOR 进一步推广至音视频事件定位并同样取得新的 SOTA。代码见:https://github.com/Franklin905/VALOR。

关键词

引用

@article{arxiv.2305.17343,
  title  = {Modality-Independent Teachers Meet Weakly-Supervised Audio-Visual Event Parser},
  author = {Yung-Hsuan Lai and Yen-Chun Chen and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2305.17343},
  year   = {2023}
}

备注

NeurIPS 2023