中文

用于流式口语理解的多任务 RNN-T 与语义解码器

计算与语言 2022-04-04 v1 声音 音频与语音处理

摘要

端到端口语理解(E2E SLU)因相较于传统级联流程具有联合优化和低延迟的优势而受到越来越多的关注。现有 E2E SLU 模型通常遵循两阶段配置:先由自动语音识别(ASR)网络预测转写文本,再通过接口传递给自然语言理解(NLU)模块以推断语义标签,如意图和槽位标签。然而,该设计在做出转写预测时未考虑 NLU 后验,也未通过考虑先前预测的词片立即纠正 NLU 预测错误。此外,两阶段系统中的 NLU 模型不可流式处理,因其必须等待音频段处理完成,这最终影响了 SLU 系统的延迟。本工作中,我们提出一种流式多任务语义转导器模型以解决这些问题。我们提出的架构以自回归方式预测 ASR 和 NLU 标签,并使用语义解码器在通过融合网络聚合的同时吸收先前预测的词片和槽位标签。利用工业级 SLU 和公开 FSC 数据集,我们展示了所提模型在 ASR 和 NLU 指标上均优于两阶段 E2E SLU 模型。

关键词

引用

@article{arxiv.2204.00558,
  title  = {Multi-task RNN-T with Semantic Decoder for Streamable Spoken Language Understanding},
  author = {Xuandi Fu and Feng-Ju Chang and Martin Radfar and Kai Wei and Jing Liu and Grant P. Strimel and Kanthashree Mysore Sathyendra},
  journal= {arXiv preprint arXiv:2204.00558},
  year   = {2022}
}

备注

Accepted at ICASSP 2022