用于联合自动语音识别与口语理解的非自回归端到端方法
音频与语音处理
2023-04-24 v1 声音
摘要
本文提出将非自回归(NAR)方法用于联合自动语音识别(ASR)与口语理解(SLU)任务。所提出的NAR系统采用Conformer编码器,应用连接时序分类(CTC)将语音话语转写为原始ASR假设,并进一步用类双向编码器表示从Transformers(BERT)的解码器进行精炼。同时,该话语的意图与槽位标签使用同一解码器同步预测。本研究探讨了Mask-CTC与自条件CTC(SC-CTC)两种途径。在SLURP数据集上的实验表明,相较于基于Conformer-Transformer的自回归(AR)模型,所提出的SC-Mask-CTC NAR系统在SLU指标上取得了3.7%和3.2%的绝对提升,并达到具竞争力的ASR准确率水平。此外,NAR系统的解码速度比AR基线快6倍。
引用
@article{arxiv.2304.10869,
title = {Non-autoregressive End-to-end Approaches for Joint Automatic Speech Recognition and Spoken Language Understanding},
author = {Mohan Li and Rama Doddipatla},
journal= {arXiv preprint arXiv:2304.10869},
year = {2023}
}
备注
8 pages, 1 figure, accepted at IEEE SLT2023