2015年谢菲尔德多类型广播媒体转录系统
计算与语言
2016-11-15 v1
摘要
我们描述了谢菲尔德大学参与2015年多类型广播(MGB)挑战中多类型广播节目转录任务所构建的系统。转录是MGB挑战提出的四项任务之一,旨在推进广播媒体的自动语音识别、说话人日记化(speaker diarisation)和字幕自动对齐的最先进水平。本工作研究了四个主题:用于不可靠数据训练的数据选择技术、广播媒体节目的自动语音分割、高度可变环境中的声学建模与自适应、以及多类型节目的语言建模。最终系统以多遍方式运行,使用初始未自适应解码阶段来精炼分割,随后三个自适应遍:基于说话人倒谱归一化的混合DNN遍、基于说话人特征MLLR变换归一化输入特征的另一个混合阶段、以及基于瓶颈的串联阶段(带噪声和说话人因子分解)。这三个系统输出的组合在由47个多类型节目组成的官方开发集上给出了27.5%的最终错误率。
引用
@article{arxiv.1512.06643,
title = {The 2015 Sheffield System for Transcription of Multi-Genre Broadcast Media},
author = {Oscar Saz and Mortaza Doulaty and Salil Deena and Rosanna Milner and Raymond W. M. Ng and Madina Hasan and Yulan Liu and Thomas Hain},
journal= {arXiv preprint arXiv:1512.06643},
year = {2016}
}
备注
IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2015), 13-17 Dec 2015, Scottsdale, Arizona, USA