用于基于 Transformer 的 LVCSR 的带有深度声学结构的自混合注意力解码器
音频与语音处理
2020-09-16 v2 声音
摘要
Transformer 在自动语音识别中展现出了优异的性能。它采用带有自注意力的编码器-解码器结构,以学习源输入的高层表示与目标输出嵌入之间的关系。在本文中,我们提出了一种新颖的解码器结构,该结构以带有深度声学结构(DAS)的自混合注意力解码器(SMAD)为特征,以改善基于 Transformer 的 LVCSR 的声学表示。具体而言,我们引入了自注意力机制来学习多层深度声学结构,以实现多层次的声学抽象。我们还设计了一种混合注意力机制,在共享嵌入空间中同时学习不同层次声学抽象与其对应语言信息之间的对齐关系。在 Aishell-1 上的 ASR 实验表明,所提出的结构在 dev 集上实现了 4.8% 的 CER,在 test 集上实现了 5.1% 的 CER,据我们所知,这是在该任务上取得的最佳结果。
引用
@article{arxiv.2006.10407,
title = {Self-and-Mixed Attention Decoder with Deep Acoustic Structure for Transformer-based LVCSR},
author = {Xinyuan Zhou and Grandee Lee and Emre Yılmaz and Yanhua Long and Jiaen Liang and Haizhou Li},
journal= {arXiv preprint arXiv:2006.10407},
year = {2020}
}
备注
Accepted by INTERSPEECH 2020