ASR4REAL:一个扩展的语音模型基准
音频与语音处理
2021-10-19 v1 人工智能
计算与语言
机器学习
声音
摘要
流行的 ASR 基准如 Librispeech 与 Switchboard 在所代表的场景与说话人多样性上有限。我们引入一组匹配真实生活条件的基准,旨在发现模型中可能的偏差与弱点。我们发现,尽管近期模型似乎未表现出性别偏差,它们通常显示出因口音而异的显著性能差异,且依说话人社会经济地位的差异更为显著。最后,所有被测模型在对话语音测试时均表现出严重的性能下降,且在此特定情形下,即便是在如 Common Crawl 般大规模数据集上训练的语言模型似乎也无显著正向效果,这再次凸显了发展对话语言模型的重要性。
引用
@article{arxiv.2110.08583,
title = {ASR4REAL: An extended benchmark for speech models},
author = {Morgane Riviere and Jade Copet and Gabriel Synnaeve},
journal= {arXiv preprint arXiv:2110.08583},
year = {2021}
}
备注
Submitted to ICASSP 2022