无需完整转写文本的端到端口语语言理解
计算与语言
2020-10-01 v1 机器学习
声音
音频与语音处理
摘要
口语语言理解(SLU)的一个核心组成部分是槽填充:使用语义实体标签表示口语 utterance 的含义。在本文中,我们开发了端到端(E2E)口语语言理解系统,其直接将语音输入转换为语义实体,并探究这些 E2E SLU 模型能否仅基于语义实体标注而非逐词转写文本进行训练。训练此类模型非常有用,因为它们可大幅降低数据收集成本。我们通过改编最初为语音识别训练的模型,创建了两类此类语音到实体模型:一个 CTC 模型和一个基于注意力的编码器-解码器模型。鉴于我们的实验涉及语音输入,这些系统需要正确识别实体标签及代表实体值的词。在 ATIS 语料库上的语音到实体实验中,CTC 与注意力模型均展现出跳过非实体词的出色能力:仅以实体训练相对于完整转写训练性能下降甚微。我们还探索了实体顺序与 utterance 中语音顺序未必相关的场景。凭借其重排序能力,注意力模型表现极为优异,在语音到实体集合(speech-to-bag-of-entities)F1 分数上仅约 2% 的下降。
引用
@article{arxiv.2009.14386,
title = {End-to-End Spoken Language Understanding Without Full Transcripts},
author = {Hong-Kwang J. Kuo and Zoltán Tüske and Samuel Thomas and Yinghui Huang and Kartik Audhkhasi and Brian Kingsbury and Gakuto Kurata and Zvi Kons and Ron Hoory and Luis Lastras},
journal= {arXiv preprint arXiv:2009.14386},
year = {2020}
}
备注
5 pages, to be published in Interspeech 2020