野外语音识别挑战:阿拉伯语MGB-3
计算与语言
2017-09-22 v1
摘要
本文描述了阿拉伯语MGB-3挑战——野外阿拉伯语语音识别。与去年的阿拉伯语MGB-2挑战不同,MGB-2的识别任务基于超过1200小时的半岛电视台阿拉伯语电视节目广播新闻录音,而MGB-3则强调方言阿拉伯语,使用多体裁的埃及YouTube视频集合。数据收集使用了七种体裁:喜剧、烹饪、家庭/儿童、时尚、戏剧、体育和科学(TEDx)。共计16小时的视频,在不同体裁间均匀分配,被划分为适应集、开发集和评估数据集。阿拉伯语MGB挑战包含两项任务:A)语音转写,在MGB-3测试集上进行评估,同时使用10小时的MGB-2测试集以报告在MGB-2评估上的进展;B)阿拉伯语方言识别,今年新引入的任务,旨在区分四种主要的阿拉伯语方言——埃及方言、黎凡特方言、北非方言、海湾方言,以及现代标准阿拉伯语。每种方言提供了两小时音频用于开发,另外两小时用于评估。对于方言识别,除了原始音频录音外,还向参与者提供了词汇特征和i-vector瓶颈特征。总体而言,十三支团队向挑战提交了十个系统。我们概述了每个系统采用的方法,并总结了评估结果。
引用
@article{arxiv.1709.07276,
title = {Speech Recognition Challenge in the Wild: Arabic MGB-3},
author = {Ahmed Ali and Stephan Vogel and Steve Renals},
journal= {arXiv preprint arXiv:1709.07276},
year = {2017}
}