中文

面向流式西藏语语音识别的上下文感知动态分块

音频与语音处理 2025-11-13 v1

摘要

本文提出了基于双向隐式自注意力(Conformer)和大语言模型(LLM)的自动语音识别(ASR)系统,采用基于块的注意力掩码实现非自回归解码。ASR系统常依赖自回归(AR)Transformer 解码器架构,其序列性质限制了高效并行推理。为此,非自回归(NAR)方法主要旨在在保持与AR基线相当的识别准确率的同时实现显著解码加速。本文提出的NAR块状注意力掩码解码器(AMD)有效提升了解码效率,同时维持ASR准确率,并能灵活平衡性能与效率之间的权衡,适用于Conformer和基于LLM的ASR系统。该AMD在输出标签的连续块内执行并行推理,同时维持块之间从左到右的单调预测。设计了一种单遍束搜索算法,用于动态融合Connectionist Temporal Classification(CTC)、AR解码器和AMD概率。在LS960和DBank老年语音数据集上进行实验,分别针对:a) 使用滤谱特征的Conformer 编码器-解码器ASR系统;b) 其与WavLM特征的集成;c) 进一步集成基于LLM的解码器。在LS960任务上,所提AMD使三段解码器相对于CTC + AR基线实现了最高达1.44倍、1.55倍和2.31倍的解码加速比,且未见显著WER增长。

关键词

引用

@article{arxiv.2511.09084,
  title  = {Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask},
  author = {Tianzi Wang and Xurong Xie and Zengrui Jin and Mengzhe Geng and Jiajun Deng and Zhaoqing Li and Shoukang Hu and Shujie Hu and Guinan Li and Mingyu Cui and Helen Meng and Xunying Liu},
  journal= {arXiv preprint arXiv:2511.09084},
  year   = {2025}
}

备注

Accepted by regular paper in the IEEE Transactions on Audio, Speech and Language Processing (TASLP)