面向端侧口语理解的审议模型
计算与语言
2022-09-08 v3 音频与语音处理
摘要
我们提出了一种新颖的基于审议的方法用于端到端(E2E)口语理解(SLU):流式自动语音识别(ASR)模型生成第一遍假设,第二遍自然语言理解(NLU)组件通过以 ASR 的文本与音频嵌入为条件来生成语义解析。通过将 E2E SLU 表述为一个广义解码器,我们的系统能够支持复杂的组合式语义结构。此外,ASR 与 NLU 之间的参数共享使得该系统特别适合资源受限(端侧)环境;在 TOPv2 数据集的口语版本(STOP)上,我们提出的方法以 0.60% 至 0.65% 的优势持续优于强流水线 NLU 基线。我们证明,文本与音频特征的融合,加上系统重写第一遍假设的能力,使我们的方法对 ASR 错误更具鲁棒性。最后,我们表明,在从自然语音迁移到合成语音训练时,我们的方法能显著减少性能退化,但要使文本转语音(TTS)成为扩展 E2E SLU 的可行方案,仍需更多工作。
引用
@article{arxiv.2204.01893,
title = {Deliberation Model for On-Device Spoken Language Understanding},
author = {Duc Le and Akshat Shrivastava and Paden Tomasello and Suyoun Kim and Aleksandr Livshits and Ozlem Kalinli and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2204.01893},
year = {2022}
}
备注
Accepted for publication at INTERSPEECH 2022