基于 Transformer 的残差高斯自注意力端到端语音识别
声音
2021-10-11 v4 计算与语言
机器学习
音频与语音处理
摘要
自注意力(SA)根据其向量序列的成对相似性进行编码,因其强大的上下文建模能力而广泛用于语音识别。然而,当应用于长序列数据时,其准确率会下降。这是由于加权平均算子可能导致注意力分布分散,从而忽略相邻信号之间的关系。为解决此问题,本文引入相对位置感知自注意力(RPSA)。它不仅保持了自注意力的全局依赖建模能力,还提升了局部性建模能力。由于原始 RPSA 的局部窗口长度固定且对不同的测试数据敏感,我们在此提出高斯自注意力(GSA),其窗口长度可学习并能自动适应测试数据。我们进一步将 GSA 推广到一种新的残差高斯自注意力(resGSA)以提升性能。我们将 RPSA、GSA 和 resGSA 分别应用于基于 Transformer 的语音识别。在 AISHELL-1 中文语音识别语料库上的实验结果证明了所提方法的有效性。例如,resGSA-Transformer 在测试集上取得了 5.86% 的字错误率(CER),相对比 SA-Transformer 低 7.8%。尽管所提 resGSA-Transformer 的性能仅略优于 RPSA-Transformer,但它无需手动调整窗口长度。
引用
@article{arxiv.2103.15722,
title = {Transformer-based end-to-end speech recognition with residual Gaussian-based self-attention},
author = {Chengdong Liang and Menglong Xu and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2103.15722},
year = {2021}
}
备注
There is an error in the description of section 3.2.1