用于流式自监督语音表征学习的低延迟注意力模块
声音
2024-03-19 v2 计算与语言
机器学习
音频与语音处理
摘要
Transformer是深度学习的基本构建块,而注意力机制是Transformer的核心组件。自监督语音表征学习(SSRL)是Transformer架构的一种流行用例。由于Transformer的因果无关(acausal)行为,其用于SSRL主要集中于因果无关应用。然而,若干媒体处理问题(如语音处理)需要实时解决方案。本文中,我们提出一种注意力模块实现,能以低计算与内存需求训练SSRL架构,同时允许低且固定延迟的实时推理。本文提出的注意力模块包含两部分:流式注意力(SA)与低延迟流式注意力(LLSA)。SA是我们针对高效流式SSRL实现的提议,而LLSA解决了其他流式注意力架构(如掩码因果无关注意力(MAA))的延迟累积问题,即便堆叠多层也保证延迟等于一层。我们以自动语音识别为下游任务训练流式SSRL,对原始注意力(此处称因果无关注意力(AA))、SA与LLSA进行比较分析。在librispeech-clean-100上训练并于librispeech-test-clean上测试时,我们的低延迟注意力模块词错率(WER)为5.84%,较MAA(WER=13.82%)显著提升。我们的实现还将推理延迟从1.92秒降至0.16秒。所提低延迟模块保留了传统因果无关Transformer的诸多优势,同时实现了使其适用于实时流式应用的延迟特性。
引用
@article{arxiv.2302.13451,
title = {A low latency attention module for streaming self-supervised speech representation learning},
author = {Jianbo Ma and Siqi Pan and Deepak Chandran and Andrea Fanelli and Richard Cartwright},
journal= {arXiv preprint arXiv:2302.13451},
year = {2024}
}
备注
19 pages, 4 figures