MGB-2挑战赛:阿拉伯多方言广播媒体识别
计算与语言
2019-09-04 v3
摘要
本文描述了面向SLT-2016的阿拉伯多类型广播(MGB-2)挑战赛。与去年聚焦于多样电视类型识别的英语MGB挑战赛不同,今年的挑战赛侧重于处理阿拉伯语音中的方言多样性。音频数据来自2005年3月至2015年12月Aljazeera阿拉伯电视频道的19个不同节目。节目分为三组:对话、采访和报道。已发布总计1200小时带有轻监督转写的数据用于声学建模。对于语言建模,我们提供了从Aljazeera阿拉伯网站Aljazeera.net爬取的、涵盖2000-2011十年超过1.1亿词的数据。提供了两部词典,一部基于音素,一部基于字素。最后,今年的挑战赛提出了两项任务:标准语音转写与词对齐。本文描述了MGB挑战赛中使用的任务数据与评估过程,并总结了所获得的结果。
引用
@article{arxiv.1609.05625,
title = {The MGB-2 Challenge: Arabic Multi-Dialect Broadcast Media Recognition},
author = {Ahmed Ali and Peter Bell and James Glass and Yacine Messaoui and Hamdy Mubarak and Steve Renals and Yifan Zhang},
journal= {arXiv preprint arXiv:1609.05625},
year = {2019}
}