语音到语义:通过全神经接口联合改进 ASR 与 NLU
计算与语言
2021-02-16 v1 音频与语音处理
摘要
我们考虑口语理解(SLU)的问题,即从主要面向语音助手的语音中提取自然语言意图及相关的槽位参数或命名实体。此类系统同时包含自动语音识别(ASR)与自然语言理解(NLU)。可以构建符合特定需求的端到端联合 SLU 模型,从而有机会部署于硬件受限的场景,例如使语音助手以离线、隐私保护的方式工作并降低服务器成本的设备。我们首先提出直接从语音中提取话语意图而无需中间文本输出的模型。接着提出一个组合模型,其使用 Listen Attend Spell ASR 系统生成转录文本,再通过神经 NLU 模型提取语义解释。最后,我们将这些方法与一个联合训练的端到端联合 SLU 模型进行对比,该模型由 ASR 与 NLU 子系统构成,二者通过基于神经网络的接口而非文本相连,可同时产生转录文本与 NLU 解释。我们表明,联合训练模型通过融入来自 NLU 的语义信息改进了 ASR,并通过将其暴露于隐藏层中编码的 ASR 混淆而改进了 NLU。
引用
@article{arxiv.2008.06173,
title = {Speech To Semantics: Improve ASR and NLU Jointly via All-Neural Interfaces},
author = {Milind Rao and Anirudh Raju and Pranav Dheram and Bach Bui and Ariya Rastrow},
journal= {arXiv preprint arXiv:2008.06173},
year = {2021}
}
备注
Proceedings of INTERSPEECH