基于非自回归模型与来自 BERT 的跨模态知识迁移的端到端快速语音识别
计算与语言
2021-08-31 v6 人工智能
音频与语音处理
摘要
基于注意力的编码器-解码器(AED)模型在语音识别中取得了令人瞩目的性能。然而,由于解码器以自回归方式预测文本词元(如字符或词),AED 模型难以并行预测所有词元,这使得推理速度相对较慢。我们认为,由于编码器已隐式地捕获了具有词元级关系的整个语音语句,我们可在无需显式自回归语言建模的情况下预测词元。当某个词元的预测不依赖于其他词元时,序列中所有词元的并行预测是可实现的。基于这一思想,我们提出了一种称为 LASO(Listen Attentively, and Spell Once,专注聆听一次拼写)的非自回归语音识别模型。该模型由编码器、解码器与位置相关摘要器(PDS)组成。三个模块均基于基础注意力块。编码器从语音中提取高层表示;PDS 利用对应于词元的位置编码将声学表示转换为词元级表示;解码器进一步通过自注意力机制捕获词元级关系;最后,为每个词元位置计算词表上的概率分布。因此,语音识别被重新表述为一个位置式分类问题。此外,我们提出一种跨模态迁移学习方法,从大规模预训练语言模型 BERT 中提炼语义以改进性能。
引用
@article{arxiv.2102.07594,
title = {Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT},
author = {Ye Bai and Jiangyan Yi and Jianhua Tao and Zhengkun Tian and Zhengqi Wen and Shuai Zhang},
journal= {arXiv preprint arXiv:2102.07594},
year = {2021}
}
备注
14 pages, 7 figures