中文

CCATMos:用于非侵入式语音质量评估的卷积上下文感知Transformer网络

音频与语音处理 2022-11-07 v1 机器学习 声音

摘要

语音质量评估在许多与语音通信相关的应用中(如电话和在线会议)一直是一个关键组成部分。传统的侵入式语音质量评估需要退化语音的干净参考才能提供准确的质量度量。这一要求限制了这些方法在真实场景中的可用性。另一方面,非侵入式主观测量是评估语音质量的“黄金标准”,因为人类听者能够凭直觉轻松评估任何退化语音的质量。在本文中,我们提出了一种称为卷积上下文感知Transformer(CCAT)网络的新型端到端模型结构,用于预测人类评分者的平均意见分数(MOS)。我们在三个带有MOS标注、涵盖多种语言和失真类型的数据集上评估了我们的模型,并将结果提交至ConferencingSpeech 2022挑战赛。我们的实验表明,与当前最先进的非侵入式语音评估模型相比,CCAT提供了有前景的MOS预测,在挑战赛评估测试集上,与基线模型相比,平均Pearson相关系数(PCC)从0.530提升至0.697,平均RMSE从0.768降低至0.570。

关键词

引用

@article{arxiv.2211.02577,
  title  = {CCATMos: Convolutional Context-aware Transformer Network for Non-intrusive Speech Quality Assessment},
  author = {Yuchen Liu and Li-Chia Yang and Alex Pawlicki and Marko Stamenovic},
  journal= {arXiv preprint arXiv:2211.02577},
  year   = {2022}
}