将预训练语音表征作为在线会议应用中语音质量评估的特征提取器
音频与语音处理
2022-10-04 v1 声音
摘要
在线会议应用中的语音质量通常通过以平均意见分(MOS)指标形式给出的人类评判来评估。由于这种劳动密集型方法在大多数场景下无法用于大规模语音质量评估,研究重点已转向通过深度神经网络(DNN)的端到端训练实现自动化MOS预测。我们提议利用基于wav2vec的XLS-R模型的预训练语音表征,而非从零训练网络。然而,此类模型的参数量超出任务专用DNN数个数量级,这对在较小数据集上的后续微调过程构成挑战。因此,我们选择在特征提取而非微调设定下使用XLS-R的预训练语音表征,从而显著减少可训练模型参数量。我们将所提基于XLS-R的特征提取器与基于梅尔频率倒谱系数(MFCC)的提取器进行比较,并尝试在特征提取器输出上训练双向长短期记忆(Bi-LSTM)与注意力池化前馈(AttPoolFF)网络的各种组合。我们在ConferencingSpeech 2022 MOS预测任务上,以更小的均方根误差(RMSE)证明了预训练XLS-R嵌入的提升性能。
引用
@article{arxiv.2210.00259,
title = {Pre-trained Speech Representations as Feature Extractors for Speech Quality Assessment in Online Conferencing Applications},
author = {Bastiaan Tamm and Helena Balabin and Rik Vandenberghe and Hugo Van hamme},
journal= {arXiv preprint arXiv:2210.00259},
year = {2022}
}
备注
5 pages, submitted to INTERSPEECH 2022