中文

融合预训练ASR与LM执行序列生成以用于口语语言理解

计算与语言 2023-07-21 v1 声音 音频与语音处理

摘要

将预训练语音识别(ASR)与语言模型(LM)集成到SLU框架中近来受到更多关注。然而,先前方法常受预训练模型间词汇不匹配的困扰,且LM因其偏离NLU表述而无法被直接利用。本研究提出一种三遍端到端(E2E)SLU系统,将ASR与LM子网络有效集成到SLU表述中用于序列生成任务。第一遍中,我们的架构使用ASR子网络预测ASR转写文本;随后LM子网络做出初始SLU预测;最后第三遍中,斟酌(deliberation)子网络以ASR与LM子网络的表示为条件做出最终预测。我们提出的三遍SLU系统在SLURP与SLUE两个基准SLU数据集上相比级联与E2E SLU模型表现出更优性能,尤其在声学挑战性语句上。

关键词

引用

@article{arxiv.2307.11005,
  title  = {Integrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding},
  author = {Siddhant Arora and Hayato Futami and Yosuke Kashiwagi and Emiru Tsunoo and Brian Yan and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2307.11005},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2023