中文

无需完整转写文本的端到端口语语言理解

计算与语言 2020-10-01 v1 机器学习 声音 音频与语音处理

摘要

口语语言理解(SLU)的一个核心组成部分是槽填充:使用语义实体标签表示口语 utterance 的含义。在本文中,我们开发了端到端(E2E)口语语言理解系统,其直接将语音输入转换为语义实体,并探究这些 E2E SLU 模型能否仅基于语义实体标注而非逐词转写文本进行训练。训练此类模型非常有用,因为它们可大幅降低数据收集成本。我们通过改编最初为语音识别训练的模型,创建了两类此类语音到实体模型:一个 CTC 模型和一个基于注意力的编码器-解码器模型。鉴于我们的实验涉及语音输入,这些系统需要正确识别实体标签及代表实体值的词。在 ATIS 语料库上的语音到实体实验中,CTC 与注意力模型均展现出跳过非实体词的出色能力:仅以实体训练相对于完整转写训练性能下降甚微。我们还探索了实体顺序与 utterance 中语音顺序未必相关的场景。凭借其重排序能力,注意力模型表现极为优异,在语音到实体集合(speech-to-bag-of-entities)F1 分数上仅约 2% 的下降。

关键词

引用

@article{arxiv.2009.14386,
  title  = {End-to-End Spoken Language Understanding Without Full Transcripts},
  author = {Hong-Kwang J. Kuo and Zoltán Tüske and Samuel Thomas and Yinghui Huang and Kartik Audhkhasi and Brian Kingsbury and Gakuto Kurata and Zvi Kons and Ron Hoory and Luis Lastras},
  journal= {arXiv preprint arXiv:2009.14386},
  year   = {2020}
}

备注

5 pages, to be published in Interspeech 2020