探索端到端口语理解的迁移学习
计算与语言
2020-12-17 v1
摘要
Alexa、Siri 和 Google Assistant 等语音助手通常使用两阶段口语理解流水线;首先由自动语音识别(ASR)组件处理用户语音并生成文本转写,随后由自然语言理解(NLU)组件将转写映射为可操作假设。直接从语音到假设的端到端(E2E)系统更具吸引力。这些系统被证明更小、更快且优化更好。然而,它们需要海量端到端训练数据,且不利用已有的 ASR 和 NLU 训练数据。本工作中,我们提出一种 E2E 系统,旨在联合训练多个语音到文本任务(如 ASR(语音-转写)和 SLU(语音-假设))以及文本到文本任务(如 NLU(文本-假设))。我们称之为音频-文本全任务(AT-AT)模型,并展示其优于在单个任务上训练的 E2E 模型,尤其是在有限数据上训练者。我们在一个内部音乐数据集和 FluentSpeech、SNIPS Audio 两个公开数据集上展示该结果,并达到最先进结果。由于我们的模型可处理语音与文本输入序列并学习预测目标序列,它还允许我们通过仅在新域的文本-假设数据(无任何语音)上训练来实现零样本 E2E SLU。我们在 Facebook TOP 数据集上评估模型的该能力,并为零样本 E2E 性能设立新基准。我们将很快发布为 TOP 数据集收集的音频数据以供未来研究。
引用
@article{arxiv.2012.08549,
title = {Exploring Transfer Learning For End-to-End Spoken Language Understanding},
author = {Subendhu Rongali and Beiye Liu and Liwei Cai and Konstantine Arkoudas and Chengwei Su and Wael Hamza},
journal= {arXiv preprint arXiv:2012.08549},
year = {2020}
}
备注
AAAI 2021