基于跨模态Transformer的自动语音识别神经纠错模型
计算与语言
2021-07-06 v1 机器学习
摘要
我们提出了一种基于跨模态Transformer的神经纠错模型,用于精炼自动语音识别(ASR)系统的输出以排除ASR错误。一般而言,神经纠错模型由编码器-解码器网络构成,可直接对序列到序列映射问题建模。最成功的方法是同时使用输入语音及其ASR输出文本作为编码器-解码器网络的输入上下文。然而,由于不同模态的输入上下文被分别编码,传统方法无法考虑这两种不同模态输入之间的关系。为有效利用两个不同模态输入之间的相关信息,我们提出的模型基于使用Transformer的跨模态自注意力对两种不同上下文进行联合编码。我们期望跨模态自注意力能有效捕捉两种不同模态之间的关系以精炼ASR假设。我们还引入了一种浅融合技术,以高效整合第一遍ASR模型与我们提出的神经纠错模型。在日语自然语言ASR任务上的实验表明,我们提出的模型取得了优于传统神经纠错模型的ASR性能。
引用
@article{arxiv.2107.01569,
title = {Cross-Modal Transformer-Based Neural Correction Models for Automatic Speech Recognition},
author = {Tomohiro Tanaka and Ryo Masumura and Mana Ihori and Akihiko Takashima and Takafumi Moriya and Takanori Ashihara and Shota Orihashi and Naoki Makishima},
journal= {arXiv preprint arXiv:2107.01569},
year = {2021}
}
备注
Accepted to Interspeech 2021