中文

利用预训练语音与语言模型的声学与语言嵌入进行意图分类

计算与语言 2021-02-16 v1

摘要

意图分类是口语理解中的一项任务。意图分类系统通常实现为流水线处理,即先经语音识别模块再进行文本处理以分类意图。也有研究采用端到端系统,直接以声学特征为输入并分类意图。此类系统未能利用相关的语言信息,且受限于训练数据不足。本工作中,我们提出一种新颖的意图分类框架,采用从预训练语音识别系统提取的声学特征以及从预训练语言模型学到的语言特征。我们使用知识蒸馏技术将声学嵌入映射至语言嵌入。我们通过交叉注意力方法融合声学与语言嵌入以分类意图。所提方法在 ATIS 和 Fluent 语音语料库上分别取得了 90.86% 和 99.07% 的准确率。

关键词

引用

@article{arxiv.2102.07370,
  title  = {Leveraging Acoustic and Linguistic Embeddings from Pretrained speech and language Models for Intent Classification},
  author = {Bidisha Sharma and Maulik Madhavi and Haizhou Li},
  journal= {arXiv preprint arXiv:2102.07370},
  year   = {2021}
}