中文

在关键处前瞻:面向流式神经换能器的自适应非因果 Transformer

音频与语音处理 2023-05-11 v2

摘要

流式语音识别架构被用于低延迟、实时应用。此类架构通常以其因果性为特征。因果架构在每一帧发出词元,仅依赖当前与过去的信号,而非因果模型在每一步会观测到一段未来帧的窗口以提升预测精度。这种二分法构成了实时自动语音识别(ASR)系统设计的权衡:要么从严格因果架构的低延迟优势中获益但接受预测性能局限,要么实现未来上下文模型的建模收益但伴随更高的延迟代价。在本工作中,我们放宽了这一选择的约束,提出自适应非因果注意力换能器(ANCAT)。我们的架构在传统意义上是非因果的,但通过在音频流中动态选择何时依赖未来上下文以及依赖程度,以低延迟、流式方式执行。所得机制在与我们新颖的正则化算法结合后,在精度上可与非因果配置相媲美,同时显著改善延迟,缩小了与因果对应模型的差距。我们通过报告在公开可获取及生产规模的语音助手数据集上的精度与延迟对比 ASR 任务结果,实验性地展示了我们的设计。

关键词

引用

@article{arxiv.2305.04159,
  title  = {Lookahead When It Matters: Adaptive Non-causal Transformers for Streaming Neural Transducers},
  author = {Grant P. Strimel and Yi Xie and Brian King and Martin Radfar and Ariya Rastrow and Athanasios Mouchtaris},
  journal= {arXiv preprint arXiv:2305.04159},
  year   = {2023}
}

备注

Accepted to ICML 2023