具有双向解码器的 Transformer 用于语音识别
音频与语音处理
2020-08-12 v1 计算与语言
机器学习
声音
摘要
基于注意力的模型近期在端到端自动语音识别(ASR)上取得了巨大进展。然而,传统的基于 transformer 的方法通常从左至右逐 token 生成序列结果,导致右至左的上下文未被利用。本工作中,我们引入一种双向语音 transformer 以同时利用不同方向的上下文。具体而言,我们提出的 transformer 的输出包含一个从左至右目标和一个从右至左目标。在推理阶段,我们采用所引入的双向束搜索方法,其不仅能生成从左至右候选,也能生成从右至左候选,并依据分数确定最佳假设。为验证我们提出的具有双向解码器的语音 transformer(STBD),我们在 AISHELL-1 数据集上进行了大量实验。实验结果表明,STBD 相较单向语音 transformer 基线实现了 3.6% 的相对字错率降低(CERR)。此外,本文最强模型 STBD-Big 在测试集上可达到 6.64% 的字错率,且无需语言模型重打分及任何额外数据增强策略。
引用
@article{arxiv.2008.04481,
title = {Transformer with Bidirectional Decoder for Speech Recognition},
author = {Xi Chen and Songyang Zhang and Dandan Song and Peng Ouyang and Shouyi Yin},
journal= {arXiv preprint arXiv:2008.04481},
year = {2020}
}
备注
Accepted by InterSpeech 2020