中文

不可见却不未知:用于稳健评估语音质量估计模型的数据隐蔽技术

音频与语音处理 2026-01-30 v1 声音

摘要

我们引入数据隐蔽(Dataset Concealment, DSC),一种严格的新型语音质量估计模型评估和解释程序。DSC量化并分解研究结果与实际应用要求之间的性能差距,同时为模型行为和数据集特征提供上下文和额外见解。我们还展示了通过使用AlignNet的数据集Aligner来处理多个数据集训练时的语料库效应的优势。我们使用九个训练数据集和九个不可见数据集,对三个 well-studied模型:MOSNet、NISQA和基于Wav2Vec2.0的模型演示了DSC和Aligner的改进。DSC提供模型泛化能力和局限性的可解释视图,同时允许在训练时使用所有可用数据。一个额外结果是,在训练时将1000参数数据集Aligner添加到9400万参数Wav2Vec模型中,显著提高了该模型估计不可见数据语音质量的能力。

关键词

引用

@article{arxiv.2601.21110,
  title  = {Unseen but not Unknown: Using Dataset Concealment to Robustly Evaluate Speech Quality Estimation Models},
  author = {Jaden Pieper and Stephen D. Voran},
  journal= {arXiv preprint arXiv:2601.21110},
  year   = {2026}
}

备注

To be appear in Proc. ICASSP 2026