面向通用语音助手的端到端口语理解
计算与语言
2021-10-08 v2 人工智能
声音
音频与语音处理
摘要
端到端(E2E)口语理解(SLU)系统使用单一模型直接从语音预测话语语义。该领域先前的工作聚焦于固定域中的针对性任务,其中输出语义结构被先验假定且输入语音复杂度有限。在本工作中,我们提出开发用于商业语音助手(VAs)中通用 SLU 的 E2E 模型的方法。我们提出一个完全可微分的、基于 transformer 的分层系统,可在 ASR 和 NLU 两个层面进行预训练。随后在转写和语义分类损失上微调以处理多样的意图与槽位参数组合。这导致一个 SLU 系统在复杂的内部通用 VA 数据集上取得显著优于基线的结果,准确率提升 43%,同时在流行的 Fluent Speech Commands 数据集上仍达到 99% 准确率基准。我们进一步在一个困难测试集上评估我们的模型,该测试集仅包含训练中未见的槽位参数,并展示近 20% 的提升,显示了我们的方法在真正严苛的 VA 场景中的有效性。
引用
@article{arxiv.2106.09009,
title = {End-to-End Spoken Language Understanding for Generalized Voice Assistants},
author = {Michael Saxon and Samridhi Choudhary and Joseph P. McKenna and Athanasios Mouchtaris},
journal= {arXiv preprint arXiv:2106.09009},
year = {2021}
}
备注
Accepted to Interspeech 2021; 5 pages, 2 tables, 1 figure