中文

序列端到端意图与槽标签分类及定位

计算与语言 2021-06-10 v1 声音 音频与语音处理

摘要

人机交互(HCI)受到口语对话系统延迟响应的显著影响。因此,近期提出了端到端(e2e)口语语言理解(SLU)方案以降低延迟。此类方法允许直接从语音信号中提取语义信息,从而绕过对自动语音识别(ASR)系统转录文本的需求。本文中,我们提出了一种用于流式场景的紧凑型 e2e SLU 架构,其中语音信号的分块被连续处理以预测意图和槽值。我们的模型基于三维卷积神经网络(3D-CNN)和单向长短期记忆(LSTM)。我们比较了两种无对齐损失的性能:连接主义时序分类(CTC)方法及其适配版本,即连接主义时序定位(CTL)。后者不仅执行分类,还执行序列音频事件的定位。所提出的方案在 Fluent Speech Command 数据集上进行了评估,结果表明我们的模型能够处理输入语音信号,在单标签分类上 CTC 准确率达 98.97%、CTL 达 98.78%,在双标签预测上 CTC 达 95.69%、CTL 达 95.28%。

关键词

引用

@article{arxiv.2106.04660,
  title  = {Sequential End-to-End Intent and Slot Label Classification and Localization},
  author = {Yiran Cao and Nihal Potdar and Anderson R. Avila},
  journal= {arXiv preprint arXiv:2106.04660},
  year   = {2021}
}

备注

Accepted at Interspeech 2021