端到端口语理解:低资源环境下语音指令任务的性能分析
计算与语言
2022-07-19 v1 声音
音频与语音处理
摘要
口语理解(SLU)是大多数人机交互系统的核心任务。随着智能家居、智能手机和智能音箱的出现,SLU 已成为工业界的一项关键技术。在经典的 SLU 方法中,自动语音识别(ASR)模块将语音信号转写为文本表示,再由自然语言理解(NLU)模块从中提取语义信息。近年来,基于深度神经网络的端到端 SLU(E2E SLU)因受益于 ASR 与 NLU 部分的联合优化,从而限制了流水线架构的错误级联效应而获得关注。然而,关于 E2E 模型实际利用哪些语言属性从语音输入预测概念与意图,人们知之甚少。本文提出一项研究,识别 E2E 模型执行 SLU 任务所使用的信号特征及其他语言属性。该研究在需处理非英语(此处为法语)语音指令的智能家居应用领域中开展。结果表明,良好的 E2E SLU 性能并不总需要完美的 ASR 能力。此外,与流水线模型相比,E2E 模型在处理背景噪声和句法变化方面表现出更优的能力。最后,更细粒度的分析表明,E2E 模型利用输入信号的音高信息来识别语音指令概念。本文概述的结果与方法为语音处理中 E2E 模型的进一步分析提供了起点。
引用
@article{arxiv.2207.08179,
title = {End-to-End Spoken Language Understanding: Performance analyses of a voice command task in a low resource setting},
author = {Thierry Desot and François Portet and Michel Vacher},
journal= {arXiv preprint arXiv:2207.08179},
year = {2022}
}
备注
Thierry Desot, Fran\c{c}ois Portet, Michel Vacher, End-to-End Spoken Language Understanding: Performance analyses of a voice command task in a low resource setting, Computer Speech & Language, Volume 75, 2022