面向长序列数据的高斯核化自注意力及其在基于CTC的语音识别中的应用
音频与语音处理
2021-02-19 v1 声音
摘要
基于自注意力(SA)的模型近年来因其灵活的上下文建模能力,在混合与端到端自动语音识别(ASR)系统中取得了显著的性能提升。然而,将SA应用于长序列数据时精度会下降,这主要源于推理与训练数据之间的长度不匹配,因为训练数据通常为了高效训练而被划分为短片段。为缓解该不匹配,我们提出了一种新架构,它是高斯核(其本身是一种平移不变核)的一个变体。首先,我们从数学上证明,查询与键共享权重参数的自注意力等价于一个归一化核函数。通过将该核函数替换为所提出的高斯核,架构在使用帧索引技术嵌入相对位置信息后变得完全平移不变。所提出的高斯核化SA被应用于基于连接主义时序分类(CTC)的ASR。在Corpus of Spontaneous Japanese (CSJ)和TEDLIUM 3基准上的实验评估表明,所提出的SA在长序列数据中取得了精度的显著提升(例如,在CSJ中词错率从24.0%降至6.0%),且无需任何加窗技术。
引用
@article{arxiv.2102.09168,
title = {Gaussian Kernelized Self-Attention for Long Sequence Data and Its Application to CTC-based Speech Recognition},
author = {Yosuke Kashiwagi and Emiru Tsunoo and Shinji Watanabe},
journal= {arXiv preprint arXiv:2102.09168},
year = {2021}
}
备注
Accepted to ICASSP2021