中文

MSR-86K:一个用于语音识别研究的、不断发展的多语言语料库,包含86,300小时转录音频

音频与语音处理 2024-06-27 v1 计算与语言 声音

摘要

近年来,以ChatGPT为代表的多语言人工智能助手获得了极大的普及。作为人机交互的关键门户,多语言自动语音识别(ASR)也引起了广泛关注,例如Whisper系统。然而,训练数据的专有性质阻碍了研究人员对多语言ASR的研究。本文介绍了MSR-86K,一个用于语音识别研究的、不断发展的、大规模多语言语料库。该语料库来源于YouTube上可公开访问的视频,包含15种语言,总计86,300小时的转录ASR数据。我们还介绍了如何使用MSR-86K语料库和其他开源语料库来训练一个与Whisper具有竞争力的鲁棒多语言ASR模型。MSR-86K将在HuggingFace上公开发布,我们相信如此大规模的语料库将为多语言ASR的研究开辟新的途径。

关键词

引用

@article{arxiv.2406.18301,
  title  = {MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research},
  author = {Song Li and Yongbin You and Xuezhi Wang and Zhengkun Tian and Ke Ding and Guanglu Wan},
  journal= {arXiv preprint arXiv:2406.18301},
  year   = {2024}
}

备注

Accepted by InterSpeech 2024