中文

利用多语言自监督预训练模型进行序列到序列端到端口语理解

计算与语言 2023-10-11 v1 声音 音频与语音处理

摘要

已有多种利用预训练模型进行端到端口语理解(E2E-SLU)的方法被提出,然而它们的评估往往缺乏多语言设置以及需要预测词法填充项(如槽填充)的任务。在本工作中,我们提出一种统一方法,集成多语言预训练语音与文本模型,并以生成方式在四种语言的六个数据集上执行E2E-SLU,包括词法填充项的预测。我们研究了如何通过基于若干训练目标在广泛可用的语音识别数据上预训练来改进所提方法。在7000小时多语言数据上的预训练使我们最终在两个SLU数据集上超越最先进水平(SOTA),并在另外两个SLU数据集上部分超越。最后,我们考察了所提模型的跨语言能力,并在PortMEDIA-Language数据集上将已知最佳结果提升近一半,实现了23.65%的概念/值错误率。

关键词

引用

@article{arxiv.2310.06103,
  title  = {Leveraging Multilingual Self-Supervised Pretrained Models for Sequence-to-Sequence End-to-End Spoken Language Understanding},
  author = {Pavel Denisov and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2310.06103},
  year   = {2023}
}

备注

IEEE Workshop on Automatic Speech Recognition and Understanding (ASRU) 2023