替代 CNN 前端用于自动语音识别的多视角频率注意力
音频与语音处理
2023-06-13 v1 计算与语言
机器学习
声音
摘要
卷积前端是基于 Transformer 的自动语音识别中用于预处理频谱图、缩减其序列长度并类似地结合时间与频率局部信息的典型选择。然而,音频频谱图的宽和高表示不同信息,例如由于混响及发音系统,时间轴具有清晰的从左至右依赖关系。相反,元音与辅音表现出非常不同的模式并占据几乎不相交的频率范围。因此,我们假设,对频率的全局注意力优于局部卷积。我们在量产级 Conformer 转导器上,以所提出的 F-Attention 模块替换其卷积神经网络前端,在 Alexa 流量上获得了 2.4% 的相对词错率降低(rWERR)。为证明泛化性,我们在公开 LibriSpeech 数据上以基于长短期记忆的 listen attend and spell 架构进行验证,获得了 4.6% 的 rWERR,并展示了对(模拟)噪声条件的鲁棒性。
引用
@article{arxiv.2306.06954,
title = {Multi-View Frequency-Attention Alternative to CNN Frontends for Automatic Speech Recognition},
author = {Belen Alastruey and Lukas Drude and Jahn Heymann and Simon Wiesler},
journal= {arXiv preprint arXiv:2306.06954},
year = {2023}
}