基于端到端神经 Transformer 的口语理解
计算与语言
2020-08-26 v1 声音
音频与语音处理
摘要
口语理解(SLU)指从音频信号中推断语义信息的过程。尽管神经 Transformer 在自然语言处理(NLP)领域的前沿神经架构中持续提供最佳性能,但其在密切相关领域即口语理解(SLU)中的优势尚未被研究。本文引入一种端到端基于神经 Transformer 的 SLU 模型,可直接从音频信号中预测变长的领域、意图与槽位向量,无需中间词符预测架构。这一新架构利用自注意力机制,将音频信号变换至不同子子空间,从而提取话语隐含的语义上下文。我们的端到端 Transformer SLU 在 Fluent Speech Commands 数据集上预测领域、意图与槽位的准确率分别为 98.1%、99.6% 和 99.6%,比结合循环与卷积神经网络的 SLU 模型高出 1.4%,且模型规模比这些架构小 25%。此外,由于自注意力层中的独立子空间投影,该模型高度可并行化,使其成为设备端 SLU 的良好候选。
引用
@article{arxiv.2008.10984,
title = {End-to-End Neural Transformer Based Spoken Language Understanding},
author = {Martin Radfar and Athanasios Mouchtaris and Siegfried Kunzmann},
journal= {arXiv preprint arXiv:2008.10984},
year = {2020}
}
备注
Interspeech 2020