MSR-86K:一个用于语音识别研究的、不断发展的多语言语料库,包含86,300小时转录音频
音频与语音处理
2024-06-27 v1 计算与语言
声音
摘要
近年来,以ChatGPT为代表的多语言人工智能助手获得了极大的普及。作为人机交互的关键门户,多语言自动语音识别(ASR)也引起了广泛关注,例如Whisper系统。然而,训练数据的专有性质阻碍了研究人员对多语言ASR的研究。本文介绍了MSR-86K,一个用于语音识别研究的、不断发展的、大规模多语言语料库。该语料库来源于YouTube上可公开访问的视频,包含15种语言,总计86,300小时的转录ASR数据。我们还介绍了如何使用MSR-86K语料库和其他开源语料库来训练一个与Whisper具有竞争力的鲁棒多语言ASR模型。MSR-86K将在HuggingFace上公开发布,我们相信如此大规模的语料库将为多语言ASR的研究开辟新的途径。
引用
@article{arxiv.2406.18301,
title = {MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research},
author = {Song Li and Yongbin You and Xuezhi Wang and Zhengkun Tian and Ke Ding and Guanglu Wan},
journal= {arXiv preprint arXiv:2406.18301},
year = {2024}
}
备注
Accepted by InterSpeech 2024