用于语音识别中连接主义时序分类的自注意力网络
音频与语音处理
2019-07-02 v2 计算与语言
机器学习
声音
摘要
自注意力在自然语言处理中的成功促使其在语音识别端到端编码器-解码器架构中的近期应用。另一方面,连接主义时序分类(CTC)已发展为一种无对齐、非自回归的序列转导方法,可单独使用或用于多种多任务与解码框架中。我们提出 SAN-CTC,一种用于 CTC 的深度全自注意力网络,并证明其对于端到端语音识别是可行且具有竞争力的。SAN-CTC 训练迅速,优于现有 CTC 模型及多数编码器-解码器模型:在固定架构与单块 GPU 下,于 WSJ eval92 上 1 天内取得 4.7% 的字符错误率(CER),于 LibriSpeech test-clean 上 1 周内取得 2.8% 的 CER。经语言模型解码后的词错误率亦有类似提升。我们为语音任务梳理了该架构的动机,评估了位置与下采样方法,并探究了标签字母表(字符、音素、子词)如何影响注意力头与性能。
引用
@article{arxiv.1901.10055,
title = {Self-Attention Networks for Connectionist Temporal Classification in Speech Recognition},
author = {Julian Salazar and Katrin Kirchhoff and Zhiheng Huang},
journal= {arXiv preprint arXiv:1901.10055},
year = {2019}
}
备注
Accepted to ICASSP 2019