中文

SA-SSL-MOS:基于谱频增强的自监督学习多速率语音质量评估

音频与语音处理 2026-02-17 v1 机器学习

摘要

为估计不同取样频率(16-48 kHz)下的语音质量评估(MOS)的多速率语音,设计SQA系统具有挑战性。挑战源于缺乏覆盖多速率语音样本的MOS标注训练数据集。虽然自监督学习(SSL)模型已广泛用于SQA以提升性能,但其局限在于预训练时使用16 kHz语音,导致丢弃高采样率中出现的高频信息。为此,我们提出一种基于谱频图的SSL方法,通过平行分支结构融合高频特征(最高至48 kHz取样率)。进而引入两阶段训练方案:首先在大规模48 kHz数据集上预训练,再在较小规模的多速率数据集上微调。实验结果表明,利用SSL特征忽略的高频信息对准确的多速率SQA至关重要,而所提出的两阶段训练显著提升了当多速率数据有限时的泛化能力。

关键词

引用

@article{arxiv.2602.14785,
  title  = {SA-SSL-MOS: Self-supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment},
  author = {Fengyuan Cao and Xinyu Liang and Fredrik Cumlin and Victor Ungureanu and Chandan K. A. Reddy and Christian Schuldt and Saikat Chatterjee},
  journal= {arXiv preprint arXiv:2602.14785},
  year   = {2026}
}

备注

Accepted at ICASSP 2026