中文

Libri-Adapt:一种用于无监督域自适应的新语音数据集

音频与语音处理 2020-09-09 v1 机器学习 声音

摘要

本文介绍了一个新的数据集 Libri-Adapt,以支持语音识别模型上的无监督域自适应研究。Libri-Adapt 构建于 LibriSpeech 语料库之上,包含使用移动端和嵌入式规模麦克风录制的英语语音,涵盖 72 个不同的域,这些域代表了 ASR 模型所面临的具有挑战性的实际场景。更具体地说,Libri-Adapt 有助于研究由以下原因引起的 ASR 模型中的域偏移:a) 不同的声学环境,b) 说话人口音的变化,c) 麦克风硬件和平台软件的异构性,以及 d) 上述三种偏移的组合。我们还提供了一系列基线结果,量化了这些域偏移对 Mozilla DeepSpeech2 ASR 模型的影响。

关键词

引用

@article{arxiv.2009.02814,
  title  = {Libri-Adapt: A New Speech Dataset for Unsupervised Domain Adaptation},
  author = {Akhil Mathur and Fahim Kawsar and Nadia Berthouze and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2009.02814},
  year   = {2020}
}

备注

5 pages, Published at IEEE ICASSP 2020