基于预训练模型与适配器的端到端语音翻译:UPC 在 IWSLT 2021 的工作
计算与语言
2021-06-29 v2
摘要
本文描述了 UPC 机器翻译组向 IWSLT 2021 离线语音翻译任务的提交。该任务旨在构建一个能够将从 TED 演讲中提取的英文音频录制内容翻译为德文文本的系统。所提交的系统可以是级联或端到端的,并可使用自定义或给定的分段。我们的提交是一个端到端语音翻译系统,它结合了预训练模型(Wav2Vec 2.0 与 mBART)以及编码器与解码器之间的耦合模块,并采用了一种高效的微调技术,仅训练其总参数的 20%。我们表明,向系统中添加一个适配器(Adapter)并对其进行预训练,能够提高收敛速度与最终结果,借此我们在 MuST-C 测试集上取得了 27.3 的 BLEU 分数。我们的最终模型是一个集成模型,在同一测试集上获得了 28.22 的 BLEU 分数。我们的提交还使用了一种自定义分段算法,该算法采用预训练的 Wav2Vec 2.0 来识别不可转写文本的区间,与给定分段的结果相比,可在 IWSLT 2019 测试集上带来 2.5 至 3 个 BLEU 分数的提升。
引用
@article{arxiv.2105.04512,
title = {End-to-End Speech Translation with Pre-trained Models and Adapters: UPC at IWSLT 2021},
author = {Gerard I. Gállego and Ioannis Tsiamas and Carlos Escolano and José A. R. Fonollosa and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2105.04512},
year = {2021}
}
备注
Submitted to IWSLT 2021; changed the title and added submission results