中文

听你所想:基于神经网络的通用声音选择器

音频与语音处理 2020-06-11 v1 机器学习 声音

摘要

能够控制我们想要聆听的声学事件(AEs)将有助于开发更具可控性的可听戴设备。本文解决 AE 声音选择(或去除)问题,我们将其定义为提取(或抑制)属于一个或多个期望 AE 类别的所有声音。尽管该问题可通过源分离加 AE 分类的组合来解决,但这是一种次优的解法。此外,源分离通常要求已知源的最大数量,在处理 AEs 时可能并不实用。本文转而提出一种通用声音选择神经网络,可根据用户指定的目标 AE 类别直接从混合声中选取 AE 声音。所提框架可被显式优化以同时从多个期望 AE 类别中选择声音,且与混合声中的源数量无关。我们通过实验表明,所提方法取得了有前景的 AE 声音选择性能,并可泛化到训练时未见的源数量的混合声。

关键词

引用

@article{arxiv.2006.05712,
  title  = {Listen to What You Want: Neural Network-based Universal Sound Selector},
  author = {Tsubasa Ochiai and Marc Delcroix and Yuma Koizumi and Hiroaki Ito and Keisuke Kinoshita and Shoko Araki},
  journal= {arXiv preprint arXiv:2006.05712},
  year   = {2020}
}

备注

5 pages, 2 figures, submitted to INTERSPEECH 2020