中文

利用弱标记数据进行大规模视听声音学习

音频与语音处理 2020-06-03 v1 机器学习 声音 图像与视频处理 机器学习

摘要

识别声音是计算音频场景分析和机器感知的关键方面。在本文中,我们认为声音识别本质上是一项多模态视听任务,因为相较于仅使用音频或视觉单一模态,利用音频和视觉两种模态更容易区分声音。我们提出了一种视听融合模型,该模型从弱标记的视频记录中学习识别声音。所提出的融合模型利用注意力机制动态结合单独的音频和视觉模型的输出。在大规模声音事件数据集 AudioSet 上的实验证明了该模型的有效性,其优于单模态模型以及最先进的融合与多模态模型。我们在 Audioset 上取得了 46.16 的平均精度均值(mAP),相对先前最先进水平高出约 +4.35 mAP(相对提升:10.4%)。

关键词

引用

@article{arxiv.2006.01595,
  title  = {Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data},
  author = {Haytham M. Fayek and Anurag Kumar},
  journal= {arXiv preprint arXiv:2006.01595},
  year   = {2020}
}

备注

29th International Joint Conference on Artificial Intelligence (IJCAI 2020)