中文

基于深度学习孪生结构与成对存在矩阵的多标签声音事件检索

音频与语音处理 2020-02-24 v1 信息检索 机器学习 声音

摘要

声景的真实录音中常有多个声音事件同时发生,例如汽车喇叭声、引擎声与人声。声音事件检索是一种基于内容的搜索,旨在根据音频查询的声学或语义内容查找相似的音频样本。当前最优的声音事件检索模型聚焦于单标签音频录音(仅发生一种声音事件),而非多标签音频录音(即一段录音中发生多种声音事件)。为解决后者问题,我们提出了具有不同的深度学习架构、带孪生结构(Siamese-structure)与成对存在矩阵(Pairwise Presence Matrix)的模型。这些网络使用包含单标签与多标签声景录音的 SONYC-UST 数据集进行训练与评估。性能结果表明了我们提出模型的有效性。

关键词

引用

@article{arxiv.2002.09026,
  title  = {Multi-label Sound Event Retrieval Using a Deep Learning-based Siamese Structure with a Pairwise Presence Matrix},
  author = {Jianyu Fan and Eric Nichols and Daniel Tompkins and Ana Elisa Mendez Mendez and Benjamin Elizalde and Philippe Pasquier},
  journal= {arXiv preprint arXiv:2002.09026},
  year   = {2020}
}

备注

Paper accepted for 45th International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2020)