中文

一种用于改进环境音频标注的轻量级多模态框架

声音 2018-03-02 v2 音频与语音处理

摘要

强标签的缺乏严重限制了最先进的完全监督音频标注系统扩展到更大数据集的能力。与此同时,基于无标签视频的音视频学习模型已成功应用于音频标注,但它们不可避免地耗费大量资源且需要长时间训练。在本工作中,我们提出了一种用于环境音频标注的轻量级多模态框架。该框架的音频分支是一个基于多示例学习(MIL)的卷积循环神经网络(CRNN),使用大量弱标签的YouTube视频片段的音频轨进行训练;视频分支使用预训练的最先进图像识别网络和词嵌入从视频轨提取信息,并将视觉对象映射到声音事件。在DCASE 2017挑战赛的音频标注任务上的实验表明,融入视频信息使一个强基线音频标注系统在F1F_1分数上绝对提升了5.3%。整个系统可在单块GPU上于6小时内训练完成,并可轻易迁移到其他音频任务,如语音情感分析。

关键词

引用

@article{arxiv.1712.09680,
  title  = {A Light-Weight Multimodal Framework for Improved Environmental Audio Tagging},
  author = {Juncheng Li and Yun Wang and Joseph Szurley and Florian Metze and Samarjit Das},
  journal= {arXiv preprint arXiv:1712.09680},
  year   = {2018}
}

备注

5 pages, 3 figures, Accepted and to appear at ICASSP 2018