中文

从自监督学习模型中选择层以预测语音平均意见分

音频与语音处理 2025-08-13 v1 声音

摘要

自监督学习(SSL)模型,如 Wav2Vec2、HuBERT 和 WavLM,已广泛应用于语音处理。这些基于 Transformer 的模型由多个层组成,每一层捕获不同层级的表示。虽然先前的研究探索了其逐层表示以提高效率和性能,但语音质量评估(SQA)模型主要依赖最后一层的特征,中间层尚未得到充分研究。在这项工作中,我们系统地评估了多个 SSL 模型的不同层,用于预测平均意见分(MOS)。我们将每一层的特征输入到一个轻量级回归网络中以评估其有效性。我们的实验一致表明,早期层的特征优于或匹配最后一层的特征,从而相比传统方法和最先进的 MOS 预测模型带来了显著改进。这些发现突显了选择早期层的优势,提供了增强的性能和降低的系统复杂度。

关键词

引用

@article{arxiv.2508.08962,
  title  = {Selection of Layers from Self-supervised Learning Models for Predicting Mean-Opinion-Score of Speech},
  author = {Xinyu Liang and Fredrik Cumlin and Victor Ungureanu and Chandan K. A. Reddy and Christian Schuldt and Saikat Chatterjee},
  journal= {arXiv preprint arXiv:2508.08962},
  year   = {2025}
}

备注

Accepted at IEEE ASRU 2025