基于部分自回归推理的段级向量化束搜索
音频与语音处理
2024-02-13 v2 声音
摘要
具有自回归(AR)解码的基于注意力的编码器-解码器模型因其卓越的准确率已被证明是自动语音识别(ASR)的主导方法。然而,它们常受限于推理缓慢。这主要归因于解码器的增量计算。本工作提出了一种部分 AR 框架,其采用段级向量化束搜索,以基于混合连接主义时序分类(CTC)注意力架构提升 ASR 模型的推理速度。它首先使用贪婪 CTC 解码生成初始假设,根据其输出概率识别低置信度词符。随后我们利用解码器对这些词符执行段级向量化束搜索,以最少的 decoder 计算量并行重预测。实验结果表明,在 LibriSpeech 语料库上,我们的方法相较 AR 解码推理速度提升 12 至 13 倍,同时保持高准确率。
引用
@article{arxiv.2309.14922,
title = {Segment-Level Vectorized Beam Search Based on Partially Autoregressive Inference},
author = {Masao Someki and Nicholas Eng and Yosuke Higuchi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2309.14922},
year = {2024}
}
备注
Accepted at ASRU 2023