中文

REAL-M:面向真实混合语音的语音分离研究

音频与语音处理 2021-10-22 v1 机器学习 声音 信号处理

摘要

近年来,基于深度学习的声源分离取得了令人瞩目的成果。然而,大多数研究仍在合成数据集上评估分离模型,而最先进的技术在真实场景语音数据上的性能仍是一个悬而未决的问题。本文从两方面致力于填补这一空白。首先,我们发布了 REAL-M 数据集,一个众包的真实生活混合语音语料库。其次,我们解决了真实生活混合语音的性能评估问题,其中真实值(ground truth)不可得。我们通过精心设计一个盲的尺度不变信噪比(Scale-Invariant Signal-to-Noise Ratio, SI-SNR)神经估计器绕过了这一问题。通过用户研究,我们表明我们的估计器能可靠地评估真实混合语音上的分离性能。SI-SNR 估计器的性能预测确实与人工评判高度相关。此外,我们观察到,在评估流行的语音分离模型时,我们的估计器在 REAL-M 数据集上预测的性能趋势与在合成基准上取得的趋势紧密吻合。

关键词

引用

@article{arxiv.2110.10812,
  title  = {REAL-M: Towards Speech Separation on Real Mixtures},
  author = {Cem Subakan and Mirco Ravanelli and Samuele Cornell and François Grondin},
  journal= {arXiv preprint arXiv:2110.10812},
  year   = {2021}
}

备注

Submitted to ICASSP 2022