中文

用于联合自动语音识别与口语理解的非自回归端到端方法

音频与语音处理 2023-04-24 v1 声音

摘要

本文提出将非自回归(NAR)方法用于联合自动语音识别(ASR)与口语理解(SLU)任务。所提出的NAR系统采用Conformer编码器,应用连接时序分类(CTC)将语音话语转写为原始ASR假设,并进一步用类双向编码器表示从Transformers(BERT)的解码器进行精炼。同时,该话语的意图与槽位标签使用同一解码器同步预测。本研究探讨了Mask-CTC与自条件CTC(SC-CTC)两种途径。在SLURP数据集上的实验表明,相较于基于Conformer-Transformer的自回归(AR)模型,所提出的SC-Mask-CTC NAR系统在SLU指标上取得了3.7%和3.2%的绝对提升,并达到具竞争力的ASR准确率水平。此外,NAR系统的解码速度比AR基线快6倍。

关键词

引用

@article{arxiv.2304.10869,
  title  = {Non-autoregressive End-to-end Approaches for Joint Automatic Speech Recognition and Spoken Language Understanding},
  author = {Mohan Li and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2304.10869},
  year   = {2023}
}

备注

8 pages, 1 figure, accepted at IEEE SLT2023