中文

个性化语音增强:新模型与综合评估

音频与语音处理 2021-10-20 v1 机器学习 声音

摘要

个性化语音增强(PSE)模型利用额外线索(如 d-vectors 等说话人嵌入)实时去除背景噪声和干扰语音,从而改善各种声学场景下在线视频会议系统的语音质量。在本工作中,我们提出两个用于 PSE 的神经网络,其性能优于先前提出的 VoiceFilter。此外,我们创建了捕获视频会议期间用户可能遇到的多种场景的测试集。进一步,我们提出一种新指标来衡量目标说话人过抑制(TSOS)问题,尽管该问题在部署中具有关键重要性,此前却未得到充分研究。此外,我们提出带有语音识别后端的多任务训练。我们的结果表明,所提模型相比基线模型能取得更好的语音识别准确率、语音可懂度和感知质量,且多任务训练除提升语音识别准确率外还能缓解 TSOS 问题。

关键词

引用

@article{arxiv.2110.09625,
  title  = {Personalized Speech Enhancement: New Models and Comprehensive Evaluation},
  author = {Sefik Emre Eskimez and Takuya Yoshioka and Huaming Wang and Xiaofei Wang and Zhuo Chen and Xuedong Huang},
  journal= {arXiv preprint arXiv:2110.09625},
  year   = {2021}
}