中文

利用非配对文本数据训练端到端语音到意图系统

计算与语言 2020-10-12 v1 机器学习 声音 音频与语音处理

摘要

训练一个端到端(E2E)神经网络语音到意图(S2I)系统以直接从语音中提取意图,需要大量意图标注的语音数据,这类数据的收集耗时且昂贵。用大量语音数据训练的ASR模型初始化S2I模型可以缓解数据稀疏性。在本文中,我们尝试利用NLU文本资源。我们实现了一个基于CTC的S2I系统,其性能与最先进的传统级联SLU系统相当。我们进行了使用不同数量语音和文本训练数据的对照实验。当仅有原始数据的十分之一可用时,意图分类准确率绝对下降7.6%。假设我们有额外的文本到意图数据(无语音)可用,我们研究了两种改进S2I系统的方法:(1)迁移学习,其中用于意图分类的声学嵌入与微调的BERT文本嵌入绑定;(2)数据增强,其中使用多说话人文本到语音系统将文本到意图数据转换为语音到意图数据。所提出的方法恢复了因使用有限意图标注语音而损失性能的80%。

关键词

引用

@article{arxiv.2010.04284,
  title  = {Leveraging Unpaired Text Data for Training End-to-End Speech-to-Intent Systems},
  author = {Yinghui Huang and Hong-Kwang Kuo and Samuel Thomas and Zvi Kons and Kartik Audhkhasi and Brian Kingsbury and Ron Hoory and Michael Picheny},
  journal= {arXiv preprint arXiv:2010.04284},
  year   = {2020}
}

备注

5 pages, published in ICASSP 2020