中文

Fast-MD:具有非自回归隐藏中间状态的快速多解码器端到端语音翻译

音频与语音处理 2021-09-28 v1 计算与语言 声音

摘要

多解码器 (MD) 端到端语音翻译模型通过搜索更好的中间自动语音识别 (ASR) 解码器状态作为隐藏中间状态 (HI),展示了高翻译质量。它是一种将整体任务分解为 ASR 和机器翻译子任务的双遍解码模型。然而,由于在推理过程中对两个子任务都进行束搜索,其解码速度对于实际应用来说不够快。我们提出了 Fast-MD,这是一种快速 MD 模型,它基于连接时序分类 (CTC) 输出,通过非自回归 (NAR) 解码生成 HI,随后接一个 ASR 解码器。我们研究了两种类型的 NAR HI:(1) 使用自回归 Transformer ASR 解码器的并行 HI,以及 (2) 使用 Mask-CTC 的掩码 HI,后者结合了 CTC 和条件掩码语言模型。为了减少 ASR 解码器在训练期间进行教师强制与测试期间以 CTC 输出为条件之间的不匹配,我们还提出了在训练期间对 CTC 输出进行采样。在三个语料库上的实验评估表明,Fast-MD 在 GPU 和 CPU 上实现了比朴素 MD 模型快约 2 倍和 4 倍的解码速度,同时具有相当的翻译质量。采用 Conformer 编码器和中间 CTC 损失进一步提升了其质量,且不牺牲解码速度。

关键词

引用

@article{arxiv.2109.12804,
  title  = {Fast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates},
  author = {Hirofumi Inaguma and Siddharth Dalmia and Brian Yan and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2109.12804},
  year   = {2021}
}

备注

Accepted at IEEE ASRU 2021