基于深度学习孪生结构与成对存在矩阵的多标签声音事件检索
音频与语音处理
2020-02-24 v1 信息检索
机器学习
声音
摘要
声景的真实录音中常有多个声音事件同时发生,例如汽车喇叭声、引擎声与人声。声音事件检索是一种基于内容的搜索,旨在根据音频查询的声学或语义内容查找相似的音频样本。当前最优的声音事件检索模型聚焦于单标签音频录音(仅发生一种声音事件),而非多标签音频录音(即一段录音中发生多种声音事件)。为解决后者问题,我们提出了具有不同的深度学习架构、带孪生结构(Siamese-structure)与成对存在矩阵(Pairwise Presence Matrix)的模型。这些网络使用包含单标签与多标签声景录音的 SONYC-UST 数据集进行训练与评估。性能结果表明了我们提出模型的有效性。
引用
@article{arxiv.2002.09026,
title = {Multi-label Sound Event Retrieval Using a Deep Learning-based Siamese Structure with a Pairwise Presence Matrix},
author = {Jianyu Fan and Eric Nichols and Daniel Tompkins and Ana Elisa Mendez Mendez and Benjamin Elizalde and Philippe Pasquier},
journal= {arXiv preprint arXiv:2002.09026},
year = {2020}
}
备注
Paper accepted for 45th International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2020)