依我意而非我言:用于口语语言理解的序列损失训练
计算与语言
2021-02-16 v1 音频与语音处理
摘要
口语语言理解(SLU)系统从语音中提取转写文本以及意图或命名实体的语义,是语音激活系统的重要组成部分。SLU 模型或直接由音频提取语义,或由流水线式的自动语音识别(ASR)与自然语言理解(NLU)模型组成,其通常经由可微的交叉熵损失进行训练,即便所关注的相关性能指标为词错误率或语义错误率。本文中,我们提出基于 SLU 指标的不可微序列损失作为语义错误的代理,并利用 REINFORCE 技巧以该损失训练 ASR 与 SLU 模型。我们表明,自定义序列损失训练在公开 SLU 数据集上达到最先进水平,并在大型专有数据集上使 ASR 与 NLU 性能指标均获得 6% 的相对提升。我们还演示了语义序列损失训练范式如何仅借助语义反馈在无转写文本情况下更新 ASR 与 SLU 模型。
引用
@article{arxiv.2102.06750,
title = {Do as I mean, not as I say: Sequence Loss Training for Spoken Language Understanding},
author = {Milind Rao and Pranav Dheram and Gautam Tiwari and Anirudh Raju and Jasha Droppo and Ariya Rastrow and Andreas Stolcke},
journal= {arXiv preprint arXiv:2102.06750},
year = {2021}
}
备注
Proc. IEEE ICASSP 2021