中文

面向端到端语音识别的独立语言建模架构

计算与语言 2019-12-03 v1 音频与语音处理

摘要

基于注意力的端到端 (E2E) 自动语音识别 (ASR) 架构允许在单一网络内联合优化声学模型与语言模型。然而,在原始的 E2E ASR 架构中,承担语言模型 (LM) 作用的译码器子网络 (subnet) 以编码器输出为条件。这意味着声学编码器与语言模型相互纠缠,无法利用外部文本数据单独训练语言模型。为解决此问题,本文提出一种将译码器子网络与编码器输出解耦的新架构。如此,解耦后的子网络成为可独立训练的语言模型子网络,能够利用外部文本数据轻松更新。我们研究了两种用于更新新架构的策略。实验结果表明:1) 独立 LM 架构受益于外部文本数据,在普通话 HKUST 和英语 NSC 数据集上分别实现了 9.3% 和 22.8% 的相对字符错误率和词错误率下降;2) 所提架构与外部 LM 配合良好,并可推广至不同规模的标注数据。

关键词

引用

@article{arxiv.1912.00863,
  title  = {Independent language modeling architecture for end-to-end ASR},
  author = {Van Tung Pham and Haihua Xu and Yerbolat Khassanov and Zhiping Zeng and Eng Siong Chng and Chongjia Ni and Bin Ma and Haizhou Li},
  journal= {arXiv preprint arXiv:1912.00863},
  year   = {2019}
}