模块化混合自回归Transducer
计算与语言
2023-02-20 v2 人工智能
机器学习
声音
音频与语音处理
摘要
对于端到端语音识别,transducer模型的纯文本自适应仍然具有挑战性,因为transducer没有明确分离的声学模型(AM)、语言模型(LM)或blank模型。在本工作中,我们提出一种模块化混合自回归transducer(MHAT),其结构上分离了标签解码器和blank解码器,分别用于预测标签和blank分布,并带有共享的声学编码器。编码器与标签解码器输出被直接投影为AM和内部LM分数,然后相加以计算标签后验。我们用内部LM损失和HAT损失训练MHAT,以确保其内部LM成为一个可高效进行文本自适应的独立神经LM。此外,MHAT的文本自适应比基于内部LM减除的方法促进了更好的LM融合。在Google的大规模生产数据上,使用100B句子自适应的多领域MHAT在无需LM融合时实现了高达12.4%的相对WER降低,而在使用从400K小时训练的HAT进行LM融合时实现了21.5%的相对WER降低。
引用
@article{arxiv.2210.17049,
title = {Modular Hybrid Autoregressive Transducer},
author = {Zhong Meng and Tongzhou Chen and Rohit Prabhavalkar and Yu Zhang and Gary Wang and Kartik Audhkhasi and Jesse Emond and Trevor Strohman and Bhuvana Ramabhadran and W. Ronny Huang and Ehsan Variani and Yinghui Huang and Pedro J. Moreno},
journal= {arXiv preprint arXiv:2210.17049},
year = {2023}
}
备注
8 pages, 1 figure, in SLT 2022