自监督语音质量评估(S3QA):利用语音基础模型构建可扩展的语音质量度量
音频与语音处理
2025-10-09 v2 声音
摘要
在真实世界环境中自动评估语音质量的方法,对于开发稳健的人类语言技术和辅助设备至关重要。人类评分者提供的行为评分(例如,平均意见得分;MOS)被认为是黄金标准,但它们容易受到个体评分者之间差异的影响,难以在不同语料库之间泛化,且收集起来费时费力,从而限制了它们能够量化的声学挑战。在此,我们提出了一种新的、可扩展的自动评估语音质量的方法:自监督语音质量评估(S3QA)模型。首先,我们处理了来自多个语音语料库的高质量话语,使用了广泛的声学挑战,旨在模拟真实世界中常见的质量下降源:频率滤波、混响、背景噪声和数字压缩。其次,我们利用现有的预训练语音基础模型 WavLM,通过计算每条话语的干净版本和退化版本在嵌入空间中的余弦距离,在计算上导出了一个量化语音退化的自监督训练目标。接下来,我们训练了一个基于 Transformer 的模型,在仅给定话语退化版本的情况下预测这些余弦距离。最后,在合成混合物、NISQA 和 VOiCES 的未见测试语料库上对训练好的模型进行了评估。我们表明,在此任务上训练的 S3QA 模型能够在广泛的具有挑战性的声学条件下准确预测退化余弦距离,并且与行为评分(MOS)、语音技术性能(自动语音识别)以及留出数据的其他重要特征(例如,麦克风距离)相一致。该模型提供了一种自动化、可扩展的方法,用于评估跨越广泛声学挑战的语音质量。
引用
@article{arxiv.2506.01655,
title = {Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric},
author = {Mattson Ogg and Caitlyn Bishop and Han Yi and Sarah Robinson},
journal= {arXiv preprint arXiv:2506.01655},
year = {2025}
}
备注
1 table, seven figures, thirteen pages