中文

基于基础模型与最优传输的语音翻译:UPC在IWSLT23中的系统

计算与语言 2023-06-05 v1 声音 音频与语音处理

摘要

本文描述了UPC机器翻译组提交至IWSLT 2023离线语音翻译任务的作品。我们的语音翻译系统利用了语音基础模型(wav2vec 2.0)和文本基础模型(mBART50)。我们引入了语音与文本编码器的连体(Siamese)预训练步骤,结合CTC与最优传输(Optimal Transport),以将语音表示适配到文本模型的空间中,从而最大化从机器翻译(MT)的迁移学习。在此预训练之后,我们使用交叉熵和知识蒸馏对系统端到端微调用于语音翻译(ST)。除可用的ST语料外,我们使用SegAugment创建合成数据,以更好地使模型适应IWSLT测试集的自定义分割。我们最佳的单模型在MuST-C tst-COMMON上获得31.2 BLEU点,在IWLST.tst2020上获得29.8点,在新发布的IWSLT.ACLdev2023上获得33.4点。

关键词

引用

@article{arxiv.2306.01327,
  title  = {Speech Translation with Foundation Models and Optimal Transport: UPC at IWSLT23},
  author = {Ioannis Tsiamas and Gerard I. Gállego and José A. R. Fonollosa and Marta R. Costa-jussà},
  journal= {arXiv preprint arXiv:2306.01327},
  year   = {2023}
}

备注

IWSLT 2023