中文

用于改进语音信号退化检测与分类的语音质量嵌入

音频与语音处理 2026-05-21 v1

摘要

自动主观语音质量评估(SSQA)传统上在utterance或系统层面估计语音质量。虽然这种分辨率对较旧的传输或合成系统足够,后者产生的语音信号质量平凡,但现代系统生成高质量语音,退化现象可能仅在局部发生。通过采用合适的模型架构和正则化损失,SSQA模型在utterance水平训练的目标也可产生有用的局部语音质量预测。在本工作中,我们扩展了此类模型以产生帧级嵌入,这些嵌入按退化类型聚类。具体而言,我们在包含干净语音和退化语音的平行语料库上采用部分混合策略,并应用对比损失以区分退化类型。通过在both in-和 out-of-domain数据上的实验,我们证明了我们方法的改进效果,能够通过分析嵌入聚类来识别退化类型。

关键词

引用

@article{arxiv.2605.21332,
  title  = {Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals},
  author = {Michael Kuhlmann and Tobias Cord-Landwehr and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2605.21332},
  year   = {2026}
}

备注

Accepted to 2026 Odyssey workshop