中文

TorchAudio-Squim:TorchAudio 中无参考语音质量与可懂度度量

音频与语音处理 2023-04-05 v1

摘要

测量语音信号的质量与可懂度通常是开发语音处理系统的关键步骤。为此,在不同假设下已开发出多种度量质量与可懂度的指标。本文中,我们引入工具与一组模型,利用深度神经网络估计此类已知指标。这些模型在成熟的 TorchAudio 库中提供,该库是 PyTorch 深度学习框架内的核心音频与语音处理库。我们称之为 TorchAudio-Squim,即 TorchAudio 语音质量与可懂度度量(TorchAudio-Speech QUality and Intelligibility Measures)。更具体地,在当前版本的 TorchAudio-squim 中,我们建立并发布了用于估计客观指标中的 PESQ、STOI 和 SI-SDR 以及主观指标中的 MOS 的模型。我们开发了一种用于客观指标估计的新方法,并使用了一种近期开发的用于主观指标估计的方法。这些模型以“无参考”方式运行,即它们不需要相应的干净语音作为语音评估的参考。鉴于真实场景中干净语音的不可得以及主观评价的费力过程,此类易用工具将极大惠及语音处理的研究与开发。

关键词

引用

@article{arxiv.2304.01448,
  title  = {TorchAudio-Squim: Reference-less Speech Quality and Intelligibility measures in TorchAudio},
  author = {Anurag Kumar and Ke Tan and Zhaoheng Ni and Pranay Manocha and Xiaohui Zhang and Ethan Henderson and Buye Xu},
  journal= {arXiv preprint arXiv:2304.01448},
  year   = {2023}
}

备注

ICASSP 2023