面向非侵入式语音质量评估模型的多任务伪标签学习
音频与语音处理
2024-03-14 v3 机器学习
声音
摘要
本研究提出一种基于多任务伪标签学习(MPL)的非侵入式语音质量评估模型,称为 MTQ-Net。MPL 包含两个阶段:从预训练模型获取伪标签分数,以及执行多任务学习。评估目标为 3QUEST 指标,即语音 MOS(S-MOS)、噪声 MOS(N-MOS)和总体 MOS(G-MOS)。利用预训练的 MOSA-Net 模型估计三个伪标签:语音质量感知评估(PESQ)、短时客观可懂度(STOI)和语音失真指数(SDI)。随后采用多任务学习训练 MTQ-Net,结合有监督损失(由估计分数与真实标签之差得到)与半监督损失(由估计分数与伪标签之差得到),其中损失函数采用 Huber 损失。实验结果首先证明了 MPL 相较于从头训练模型和直接知识迁移机制的优势。其次,验证了 Huber 损失对提升 MTQ-Net 预测能力的益处。最后,采用 MPL 方法的 MTQ-Net 相较于其他基于 SSL 的语音评估模型表现出更高的整体预测能力。
引用
@article{arxiv.2308.09262,
title = {Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model},
author = {Ryandhimas E. Zezario and Bo-Ren Brian Bai and Chiou-Shann Fuh and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2308.09262},
year = {2024}
}
备注
Accepted to IEEE ICASSP 2024