中文

面向目标声音提取的新声音类别少样本学习

音频与语音处理 2021-06-15 v1 声音

摘要

目标声音提取是指从声学事件(AE)声音混合体中提取目标 AE 类别的声音。它可利用神经网络实现,该网络以表示所需 AE 类别的 1-hot 向量为条件提取目标声音。此方法下,与 AE 类别关联的嵌入向量针对训练期间所见声音类别的提取被直接优化。然而,将这一框架扩展到新的 AE 类别(即训练期间未见过)并不容易。近来,基于所需声音注册音频的语音、音乐或 AE 声音提取,提供了仅给定相似声音的短音频信号即可从混合体中提取任意目标声音的潜力。本工作中,我们提出结合 1-hot 与基于注册的的目标声音提取,从而对所见 AE 类别实现最优性能并简便扩展至新类别。在使用 Freesound Dataset(FSD)数据集生成的合成声音混合体的实验中,我们展示了该组合框架对所见与新 AE 类别的益处。此外,我们还提出对少量注册音频样本(少样本)获得的嵌入向量进行自适应,以进一步提升新类别上的性能。

关键词

引用

@article{arxiv.2106.07144,
  title  = {Few-shot learning of new sound classes for target sound extraction},
  author = {Marc Delcroix and Jorge Bennasar Vázquez and Tsubasa Ochiai and Keisuke Kinoshita and Shoko Araki},
  journal= {arXiv preprint arXiv:2106.07144},
  year   = {2021}
}

备注

To appear in Interspeech 2021