中文

ESPnet-ST IWSLT 2021离线语音翻译系统

音频与语音处理 2021-07-07 v2 计算与语言 声音

摘要

本文描述了ESPnet-ST组在IWSLT 2021离线语音翻译赛道中的提交系统。今年我们在训练数据、架构与音频分割方面做出了多种努力。在数据方面,我们研究了用于端到端(E2E)语音翻译的序列级知识蒸馏(SeqKD)。具体而言,我们使用了基于在不同规模双语文本上训练的多个教师模型的多参考SeqKD。在架构方面,我们采用了Conformer编码器与多解码器架构,该架构在统一编码器-解码器模型中为语音识别与翻译任务配备专用解码器,并能在推理时于源语言与目标语言空间中进行搜索。我们还通过使用pyannote.audio工具包并合并多个短片段以进行长上下文建模,显著改进了音频分割。实验评估表明,上述各项均对翻译性能的大幅提升有所贡献。我们最佳的E2E系统结合了所有上述技术与模型集成,在tst2021的2-ref上取得了31.4 BLEU,在tst2021的两个单参考上分别取得了21.2 BLEU与19.3 BLEU。

关键词

引用

@article{arxiv.2107.00636,
  title  = {ESPnet-ST IWSLT 2021 Offline Speech Translation System},
  author = {Hirofumi Inaguma and Brian Yan and Siddharth Dalmia and Pengcheng Guo and Jiatong Shi and Kevin Duh and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2107.00636},
  year   = {2021}
}

备注

IWSLT 2021