具有持久记忆模型的 DFSMN-SAN 用于自动语音识别
音频与语音处理
2019-10-30 v1 机器学习
声音
摘要
自注意力网络 (SAN) 已被引入自动语音识别 (ASR) 领域,并凭借其捕捉长期依赖关系的卓越能力取得了最先进的性能。其关键要素之一是自注意力机制,该机制可在整个话语级别有效执行。在本文中,我们试图探究是否可以利用并受益于超越整个话语级别的更多信息。我们提出将具有增强记忆的自注意力层应用于 ASR。具体而言,我们首先提出了一种变体模型架构,将深度前馈序列记忆网络 (DFSMN) 与自注意力层相结合,形成了比纯自注意力网络更好的基线模型。随后,我们提出并比较了两种添加到自注意力层中的额外记忆结构。在大规模连续语音识别 (LVCSR) 任务上的实验表明,在四个独立的测试集上,DFSMN-SAN 架构的字错率 (CER) 相比普通 SAN 编码器相对降低了 5%。更重要的是,额外的记忆结构使 CER 进一步相对提高了 5% 至 11%。
引用
@article{arxiv.1910.13282,
title = {DFSMN-SAN with Persistent Memory Model for Automatic Speech Recognition},
author = {Zhao You and Dan Su and Jie Chen and Chao Weng and Dong Yu},
journal= {arXiv preprint arXiv:1910.13282},
year = {2019}
}
备注
5 pages, 2 figures, subbmitted to ICASSP 2020