中文

语言障碍:评估 CNN 和 Transformer 架构在跨语言语音质量估计中的表现

计算与语言 2025-02-19 v1

摘要

客观语音质量模型旨在使用自动化方法预测人类感知的语音质量。然而,跨语言泛化仍是主要挑战,因为平均意见得分(MOS)因语言差异而变化,包括语言学、感知和数据集特有的差异。主要在英语数据上训练的模型可能难以泛化到具有不同语音、声调和韵律特征的语言,从而导致客观评估不一致。本研究 investigates 两种语音质量模型的跨语言性能:一种基于 CNN 的 NISQA 模型,以及基于 Transformer 的 Audio Spectrogram Transformer(AST)模型。两种模型均仅在包含超过 49,000 语音样本的英语数据集上进行训练,并分别在德语、法语、中文、瑞典语和荷兰语语音上进行评估。我们使用皮尔逊相关系数(PCC)和均方根误差(RMSE)分析模型性能,涵盖五个语音质量维度:色彩、连续性、音量、噪声和 MOS。我们的发现表明,尽管 AST 在跨语言性能上更稳定,但两种模型都表现出显著偏差。值得注意的是,中文语音质量预测与人类 MOS 分数高度相关,而瑞典语和荷兰语则 presents greater prediction challenges。所有语言中都难以建模连续性问题。这一结果凸显了需要更平衡的多语言数据集以及特定于体系结构的调整,以提高跨语言泛化能力的重要性。

关键词

引用

@article{arxiv.2502.13004,
  title  = {Language Barriers: Evaluating Cross-Lingual Performance of CNN and Transformer Architectures for Speech Quality Estimation},
  author = {Wafaa Wardah and Tuğçe Melike Koçak Büyüktaş and Kirill Shchegelskiy and Sebastian Möller and Robert P. Spang},
  journal= {arXiv preprint arXiv:2502.13004},
  year   = {2025}
}