深度神经网络语音质量模型中的隐层特征中存在聚类效应
音频与语音处理
2025-05-01 v1
摘要
本文提供了一个实验观察:基于深度神经网络 (DNN) 的语音质量评估 (SQA) 模型在其内在的隐层表示中存在许多失真类型的聚类。尽管 DNN-based SQA 模型并非为失配分类而训练,但我们的实验表明,在合适的 SQA 隐层表示中可以获得良好的失配分类结果。我们使用包括不同类型噪声、波形剪切、增益变化、音高移位、压缩、混响等在内的各种音频失真来研究失配的聚类。为可视化聚类,我们在 SQA 隐层表示域中使用标准的 k 近邻 (kNN) 分类器进行分类。我们还开发了一个新的 DNN-based SQA 模型,命名为 DNSMOS+,以检验改进的 SQA 是否会导致失配分类的改进。该数据集在 LibriAugmented 数据集上(包含 16 种失配类型)的分类准确率为 94%,在 ESC-50 数据集上(包含 50 种真实噪声类型)的分类准确率为 54%。
引用
@article{arxiv.2504.21528,
title = {Impairments are Clustered in Latents of Deep Neural Network-based Speech Quality Models},
author = {Fredrik Cumlin and Xinyu Liang and Victor Ungureanu and Chandan K. A. Reddy and Christian Schüldt and Saikat Chatterjee},
journal= {arXiv preprint arXiv:2504.21528},
year = {2025}
}