中文

从 BERT Transformer 到语音 Transformer 的意图分类知识蒸馏

计算与语言 2021-08-06 v1 人机交互

摘要

与使用自动语音识别(ASR)而后接自然语言处理模块的常规流水线方法相比,基于语音的端到端意图分类具有诸多优势。它试图在不使用中间 ASR 模块的情况下从语音预测意图。然而,此类端到端框架受限于口语理解中缺乏具有较高声学变化的大型语音资源。在本工作中,我们利用专为从基于 transformer 的语言模型向基于 transformer 的语音模型进行知识蒸馏而设计的 transformer 蒸馏方法。为此,我们借助可靠且广泛使用的来自 transformer 的双向编码器表示(BERT)模型作为语言模型,并将知识迁移以构建用于语音意图分类的声学模型。具体而言,设计了一个基于多级 transformer 的教师-学生模型,并在学生与教师模型不同 transformer 层的注意力子层与隐藏子层之间执行知识蒸馏。我们在 Fluent 语音语料库与 ATIS 数据库上分别取得了 99.10% 与 88.79% 的意图分类准确率。此外,与基线方法相比,所提方法在声学退化条件下表现出更好的性能与鲁棒性。

关键词

引用

@article{arxiv.2108.02598,
  title  = {Knowledge Distillation from BERT Transformer to Speech Transformer for Intent Classification},
  author = {Yidi Jiang and Bidisha Sharma and Maulik Madhavi and Haizhou Li},
  journal= {arXiv preprint arXiv:2108.02598},
  year   = {2021}
}

备注

Interspeech 2021