中文

基于真实噪声语料的音视觉语音增强挑战赛

声音 2019-10-02 v1 机器学习 音频与语音处理

摘要

本文提出首个真实噪声环境下的音视觉(AV)语音增强挑战赛。概述了该AV挑战赛的详细描述、一个新的真实噪声AV语料库(ASPIRE)、基准语音增强任务以及基线性能结果。后者基于在Grid语料库与ChiME3噪声(包括公交、行人、咖啡馆和街道噪声)的合成混合上训练深度神经架构,并在ASPIRE语料库上测试。给出了五种不同语音增强算法(包括SEAGN、谱减法(SS)、对数最小均方误差(LMMSE)、纯音频CochleaNet和AV CochleaNet)的主观评估作为基线结果。该多模态挑战赛旨在通过使用我们新的基准、真实噪声AV语料库和指定性能指标,为全面评估新颖AV语音增强算法提供及时机会。这将全球推动AV语音处理研究,激发突破性的新多模态方法,并吸引从事AV语音技术与应用的公司、学者和研究人员的兴趣。我们鼓励来自语音和听觉研究社区的参与者(通过挑战赛网站注册)参与,以受益于它们针对噪声中AV语音的互补方法。

关键词

引用

@article{arxiv.1910.00424,
  title  = {AV Speech Enhancement Challenge using a Real Noisy Corpus},
  author = {Mandar Gogate and Ahsan Adeel and Kia Dashtipour and Peter Derleth and Amir Hussain},
  journal= {arXiv preprint arXiv:1910.00424},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1909.10407