中文

基于神经离散时频表示学习的条件声音生成

音频与语音处理 2021-10-07 v3 人工智能 声音

摘要

深度生成模型近来在语音与音乐合成中取得了令人印象深刻的性能。然而,与这些特定领域声音的生成相比,生成通用声音(如警笛、枪声)尽管应用广泛,却较少受到关注。在先前工作中,SampleRNN 方法被考虑用于时域声音生成。然而,SampleRNN 仅通过有限数量的样本反向传播,在捕捉声音内长距离依赖方面存在潜在局限。在本工作中,我们提出一种通过神经离散时频表示学习、以声音类别为条件生成声音的方法。这在高效建模声音片段内长距离依赖并保留局部细粒度结构方面具有优势。我们在 UrbanSound8K 数据集上评估我们的方法,与 SampleRNN 比较,采用衡量生成声音质量与多样性的性能指标。实验结果显示,我们的方法在质量上性能相当,在多样性上显著更优。

关键词

引用

@article{arxiv.2107.09998,
  title  = {Conditional Sound Generation Using Neural Discrete Time-Frequency Representation Learning},
  author = {Xubo Liu and Turab Iqbal and Jinzheng Zhao and Qiushi Huang and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2107.09998},
  year   = {2021}
}

备注

Accepted by IEEE 31st International Worlshop on Machine Learning for Signal Processing (MLSP) 2021, 6 pages, 1 figure