中文

IWSLT 2021 BUT 语音翻译系统

计算与语言 2021-07-14 v1 声音 音频与语音处理

摘要

本文描述了 BUT 为 IWSLT2021 开发的英德离线语音翻译(ST)系统。它们基于联合训练的自动语音识别-机器翻译模型。其性能在 MustC-Common 测试集上评估。在这项工作中,我们从拥有大量独立的 ASR 训练数据与 MT 训练数据、以及较少量的语音翻译训练数据的角度研究其效率。大量 ASR 与 MT 训练数据被用于预训练 ASR 与 MT 模型。语音翻译数据通过定义从语音到翻译的端到端可微路径,用于联合优化 ASR-MT 模型。为此,我们使用来自 ASR 解码器的内部连续表示作为 MT 模块的输入。我们表明,通过使用大量纯文本 MT 训练数据将 ASR 解码器与 MT 模块联合训练,可进一步提升语音翻译效果。我们还表明,训练能够生成带标点文本的 ASR 模块,而非将标点任务留给 MT 模块,可带来显著改进。

关键词

引用

@article{arxiv.2107.06155,
  title  = {The IWSLT 2021 BUT Speech Translation Systems},
  author = {Hari Krishna Vydana and Martin Karafi'at and Luk'as Burget and "Honza" Cernock'y},
  journal= {arXiv preprint arXiv:2107.06155},
  year   = {2021}
}