中文

ASR4REAL:一个扩展的语音模型基准

音频与语音处理 2021-10-19 v1 人工智能 计算与语言 机器学习 声音

摘要

流行的 ASR 基准如 Librispeech 与 Switchboard 在所代表的场景与说话人多样性上有限。我们引入一组匹配真实生活条件的基准,旨在发现模型中可能的偏差与弱点。我们发现,尽管近期模型似乎未表现出性别偏差,它们通常显示出因口音而异的显著性能差异,且依说话人社会经济地位的差异更为显著。最后,所有被测模型在对话语音测试时均表现出严重的性能下降,且在此特定情形下,即便是在如 Common Crawl 般大规模数据集上训练的语言模型似乎也无显著正向效果,这再次凸显了发展对话语言模型的重要性。

关键词

引用

@article{arxiv.2110.08583,
  title  = {ASR4REAL: An extended benchmark for speech models},
  author = {Morgane Riviere and Jade Copet and Gabriel Synnaeve},
  journal= {arXiv preprint arXiv:2110.08583},
  year   = {2021}
}

备注

Submitted to ICASSP 2022