中文

用于音频标注与声音事件检测的视听迁移学习

音频与语音处理 2022-09-27 v1 机器学习 声音

摘要

我们研究了迁移学习对两个声音识别问题(即音频标注与声音事件检测)的价值。采用特征融合,我们将仅利用频谱声学输入的基线系统改造为同时利用预训练的听觉与视觉特征,这些特征提取自为不同任务构建并用外部数据训练的网络。我们在一个视听多标签数据集上用这些改进模型进行实验,其训练划分包含大量无标签样本和较少的弱标注片段,仅指示10类声音的片段级存在而未指定活跃听觉事件的时间边界。对于基于片段的音频标注,该迁移学习方法带来了显著改进。在此背景下,在音频之上加入视觉模态也被证明是有利的。当涉及生成音频记录的转写时,预训练特征的好处取决于所要求的时间分辨率:对于粗粒度声音事件检测,其实用性仍然显著;但当需要更细粒度的预测时,由于当前问题与预训练向量所来源模型的目标之间存在不匹配,性能提升被大幅削弱。

关键词

引用

@article{arxiv.2106.05408,
  title  = {Audiovisual transfer learning for audio tagging and sound event detection},
  author = {Wim Boes and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2106.05408},
  year   = {2022}
}

备注

submitted to INTERSPEECH 2021