中文

MOSRA:联合平均意见分与房间声学语音质量评估

音频与语音处理 2022-06-30 v2 人工智能 机器学习 声音

摘要

声学环境会在通信过程中(例如视频通话、远程演示、室外语音录制)降低语音质量,且其影响通常未知。鉴于影响语音质量的因素具有多维度特性以及标注数据收集的困难,开发语音质量的客观指标一直颇具挑战。基于声学对语音质量影响的假设,本文提出MOSRA:一种非侵入式多维语音质量指标,可在预测语音质量整体平均意见分(MOS)的同时,预测房间声学参数(SNR、STI、T60、DRR和C50)。通过显式优化模型以学习这些房间声学参数,我们能在训练数据有限时提取更具信息量的特征并改善MOS任务的泛化能力。此外,我们还表明该联合训练方法增强了房间声学的盲估计,提升了当前最先进模型的性能。该联合预测的一个额外副作用是提升了预测的可解释性,这对许多应用而言是一项宝贵特性。

关键词

引用

@article{arxiv.2204.01345,
  title  = {MOSRA: Joint Mean Opinion Score and Room Acoustics Speech Quality Assessment},
  author = {Karl El Hajal and Milos Cernak and Pablo Mainar},
  journal= {arXiv preprint arXiv:2204.01345},
  year   = {2022}
}

备注

Submitted to Interspeech 2022