OOD-Speech:用于分布外基准测试的大型孟加拉语语音识别数据集
音频与语音处理
2023-05-18 v1 计算与语言
机器学习
摘要
我们提出 OOD-Speech,首个用于孟加拉语自动语音识别(ASR)的分布外(OOD)基准测试数据集。作为全球使用最广泛的语言之一,孟加拉语在方言和韵律特征上呈现巨大多样性,这要求 ASR 框架对分布偏移具有鲁棒性。例如,孟加拉语伊斯兰宗教布道以与常规语音显著不同的音调传递。我们的训练数据集通过大规模在线众包活动收集,最终从南亚 名孟加拉语母语者处收集并整理了 1177.94 小时数据。我们的测试数据集包含从 17 个不同来源(例如孟加拉语电视剧、有声书、脱口秀、在线课程以及伊斯兰布道等)收集并人工标注的 23.03 小时语音。OOD-Speech 同时是公开可用的最大语音数据集,也是首个孟加拉语分布外 ASR 基准测试数据集。
引用
@article{arxiv.2305.09688,
title = {OOD-Speech: A Large Bengali Speech Recognition Dataset for Out-of-Distribution Benchmarking},
author = {Fazle Rabbi Rakib and Souhardya Saha Dip and Samiul Alam and Nazia Tasnim and Md. Istiak Hossain Shihab and Md. Nazmuddoha Ansary and Syed Mobassir Hossen and Marsia Haque Meghla and Mamunur Mamun and Farig Sadeque and Sayma Sultana Chowdhury and Tahsin Reasat and Asif Sushmit and Ahmed Imtiaz Humayun},
journal= {arXiv preprint arXiv:2305.09688},
year = {2023}
}