中文

FANS:融合 ASR 与 NLU 的端侧 SLU 模型

计算与语言 2021-11-02 v1 声音 音频与语音处理

摘要

口语理解(SLU)系统将语音输入命令翻译为语义,其编码为一个意图以及槽标签与值的配对。当前多数 SLU 系统部署两个神经模型的级联,其中第一个将输入音频映射为转写文本(ASR),第二个从转写文本预测意图与槽(NLU)。本文引入 FANS,一种新颖的端到端 SLU 模型,其将 ASR 音频编码器融合至多任务 NLU 解码器,从而直接从给定输入音频推断意图、槽标签与槽值,无需转写。FANS 由一个共享音频编码器和三个解码器组成,其中两个为序列到序列解码器,以自回归方式并行预测非空槽标签与槽值。FANS 的神经编码器与解码器架构灵活,允许我们利用 LSTM、自注意力与注意力机制的不同组合。我们的实验表明,相较于最先进的端到端 SLU 模型,FANS 在内部 SLU 数据集上相对降低 ICER 与 IRER 错误率分别为 30% 与 7%,在公开 SLU 数据集上绝对降低分别为 0.86% 与 2%。

关键词

引用

@article{arxiv.2111.00400,
  title  = {FANS: Fusing ASR and NLU for on-device SLU},
  author = {Martin Radfar and Athanasios Mouchtaris and Siegfried Kunzmann and Ariya Rastrow},
  journal= {arXiv preprint arXiv:2111.00400},
  year   = {2021}
}

备注

Published in Interspeech 2021