中文

基于模态无关元学习的数据高效端到端语音到文本翻译

计算与语言 2020-04-29 v2 机器学习 声音 音频与语音处理

摘要

端到端语音翻译 (ST) 模型相比结合自动语音识别 (ASR) 与文本机器翻译 (MT) 模型的传统流水线具有若干优势,如更低延迟、更小模型规模以及更少的错误累积。然而,为 ST 任务收集大量平行数据比 ASR 和 MT 任务更困难。先前研究提出使用迁移学习方法来克服上述困难。这些方法受益于弱监督训练数据,例如 ASR 语音-转录文本对或 MT 文本-文本翻译对。然而,这些模型中的参数针对每个任务是独立更新的,可能导致次优解。本工作中,我们采用元学习算法训练一个模态无关多任务模型,将知识从源任务=ASR+MT 迁移到严重缺乏数据的目标任务=ST。在元学习阶段,模型参数暴露于大量语音转录文本(如英语 ASR)与文本翻译(如英语-德语 MT)中。在此阶段,参数以如下方式更新:理解语音、文本表示及其间关系,并作为目标 ST 任务的良好初始化点。我们在 Multilingual Speech Translation Corpus (MuST-C) 的英语-德语 (En-De) 与英语-法语 (En-Fr) 语言对上评估所提元学习方法的 ST 任务。我们的方法优于先前的迁移学习方法,并以分别获得 9.18 和 11.76 BLEU 点的提升为 En-De 和 En-Fr ST 任务确立了新的 SOTA 结果。

关键词

引用

@article{arxiv.1911.04283,
  title  = {Data Efficient Direct Speech-to-Text Translation with Modality Agnostic Meta-Learning},
  author = {Sathish Indurthi and Houjeung Han and Nikhil Kumar Lakumarapu and Beomseok Lee and Insoo Chung and Sangha Kim and Chanwoo Kim},
  journal= {arXiv preprint arXiv:1911.04283},
  year   = {2020}
}

备注

ICASSP 2020