中文

基于知识蒸馏的端到端语音翻译:FBK@IWSLT2020

计算与语言 2020-06-05 v1 声音 音频与语音处理

摘要

本文描述了 FBK 参与 IWSLT 2020 离线语音翻译(ST)任务的情况。该任务评估系统将英语 TED 演讲音频翻译为德语文本的能力。测试演讲提供两个版本:一版为已用自动工具分割的数据,另一版为无任何分割的原始数据。参与者可决定是否进行自定义分割。我们使用了所提供的分割。我们的系统是基于 Transformer 针对语音数据改编的端到端模型。其训练过程是本文的重点,基于:i) 迁移学习(ASR 预训练与知识蒸馏),ii) 数据增强(SpecAugment、时间拉伸与合成数据),iii) 将合成与真实数据标记为不同域进行结合,以及 iv) 使用 CTC 损失的多任务学习。最后,在完成词级知识蒸馏训练后,我们的 ST 模型使用标签平滑交叉熵进行微调。我们的最佳模型在 MuST-C En-De 测试集上取得 29 BLEU,与近期论文相比是出色的结果,在相同数据经 VAD 分割下取得 23.7 BLEU,显示出研究解决该特定数据条件方案的必要性。

关键词

引用

@article{arxiv.2006.02965,
  title  = {End-to-End Speech-Translation with Knowledge Distillation: FBK@IWSLT2020},
  author = {Marco Gaido and Mattia Antonino Di Gangi and Matteo Negri and Marco Turchi},
  journal= {arXiv preprint arXiv:2006.02965},
  year   = {2020}
}

备注

Accepted at IWSLT2020