端到端语音识别中用于对话上下文融合的门控嵌入
计算与语言
2019-06-28 v1 声音
音频与语音处理
摘要
我们提出一种新颖的对话上下文感知端到端语音识别器,它基于一个融合了对话上下文/词/语音嵌入的门控神经网络。与传统语音识别模型不同,我们的模型学习跨句子的更长对话上下文信息,因而能更好地识别长对话。具体来说,我们建议在端到端框架内使用基于文本的外部词和/或句子嵌入(即 fastText、BERT),从而显著改善词错误率,并获得更好的对话上下文表示。我们在 Switchboard 对话语音语料库上评估了模型,结果表明我们的模型优于标准端到端语音识别模型。
引用
@article{arxiv.1906.11604,
title = {Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion},
author = {Suyoun Kim and Siddharth Dalmia and Florian Metze},
journal= {arXiv preprint arXiv:1906.11604},
year = {2019}
}
备注
ACL 2019