基于格的轻监督声学模型训练
计算与语言
2019-07-16 v2 声音
音频与语音处理
摘要
在广播领域存在大量相关文本数据和部分转写,如隐藏字幕和字幕。该文本数据可用于轻监督训练,其中使用现有语音识别模型选择与音频匹配的文本。当前轻监督方法通常基于转写与偏置解码假设之间的匹配错误率来过滤数据。相反,半监督训练不需要匹配文本数据,而是使用背景语言模型生成假设。最先进的半监督训练使用基于格的监督和无格MMI(LF-MMI)目标函数。我们提出一种技术,将不准确的转写与为半监督训练生成的格相结合,从而在适当处保留格中的不确定性。我们证明这种组合方法降低了格上的期望错误率,并降低了广播任务上的词错误率(WER)。
引用
@article{arxiv.1905.13150,
title = {Lattice-based lightly-supervised acoustic model training},
author = {Joachim Fainberg and Ondřej Klejch and Steve Renals and Peter Bell},
journal= {arXiv preprint arXiv:1905.13150},
year = {2019}
}
备注
Proc. INTERSPEECH 2019