中文

XLS-R 用于语音质量评估的分析

音频与语音处理 2023-08-24 v1 声音

摘要

在在线会议应用中,估计音频信号的感知质量对于确保终端用户的高体验质量至关重要。评估语音信号质量最可靠的方式是通过以平均意见分数(MOS)指标形式给出的人类判断。然而,这种方法劳动密集且不可行于大规模应用。因此,焦点已转向通过深度神经网络的端到端训练实现自动化语音质量评估。最近,研究表明利用预训练的基于 wav2vec 的 XLS-R 嵌入可在语音质量预测任务上取得最先进(state-of-the-art, SOTA)性能。本文中,我们对预训练模型进行深入分析。首先,我们分析从 XLS-R 每一层提取的嵌入以及每种模型规模(300M、1B、2B 参数)的性能。令人惊讶地,我们发现特征提取的两个最优区域:一个在低级特征中,一个在高级特征中。接下来,我们探究两个明显最优点的原因。我们假设低级特征捕获噪声与房间声学特性,而高级特征关注语音内容与可懂度。为此,我们分析了 MOS 预测对各类别中不同级别损伤的敏感性。之后,我们尝试融合两个最优特征深度以确定它们是否为 MOS 预测包含互补信息。最后,我们比较所提模型的性能并评估模型在未见数据集上的泛化能力。

关键词

引用

@article{arxiv.2308.12077,
  title  = {Analysis of XLS-R for Speech Quality Assessment},
  author = {Bastiaan Tamm and Rik Vandenberghe and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2308.12077},
  year   = {2023}
}

备注

5 pages, submitted to WASPAA 2023