中文

基于跨模态师生学习的预训练语义语音嵌入用于端到端口语理解

音频与语音处理 2020-08-13 v2 计算与语言 机器学习 声音

摘要

口语理解通常基于包含语音识别与自然语言理解步骤的流水线架构。这些组件被独立优化以利用可用数据,但整体系统受限于错误传播。本文中,我们提出一种新颖的训练方法,使预训练上下文嵌入能够处理声学特征。具体而言,我们为其扩展一个预训练语音识别系统的编码器,以构建端到端口语理解系统。我们提出的方法基于跨语音与文本模态的师生框架,该框架对齐声学与语义潜空间。在三个基准上的实验结果表明,我们的系统在不使用任何训练数据的情况下达到了与流水线架构相当的性能,并在三个基准中的两个上以每类十个样本微调后优于该架构。

关键词

引用

@article{arxiv.2007.01836,
  title  = {Pretrained Semantic Speech Embeddings for End-to-End Spoken Language Understanding via Cross-Modal Teacher-Student Learning},
  author = {Pavel Denisov and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2007.01836},
  year   = {2020}
}

备注

Interspeech 2020