弥合端到端语音翻译中预训练与微调之间的差距
计算与语言
2019-11-19 v3 音频与语音处理
摘要
端到端语音翻译是近年来的热点,旨在用端到端模型将一段音频翻译成特定语言。传统方法采用多任务学习和预训练方法来处理该任务,但它们受困于预训练与微调之间的巨大差距。为解决这些问题,我们提出了串联连接主义编码网络(Tandem Connectionist Encoding Network, TCEN),它通过重用微调中的所有子网络、保持子网络角色一致以及预训练注意力模块来弥合差距。此外,我们提出两种简单而有效的方法,以在语义表示和序列长度方面保证语音编码器输出与机器翻译(MT)编码器输入的一致性。实验结果表明,我们的模型在大型基准数据集上比基线高出2.2 BLEU。
引用
@article{arxiv.1909.07575,
title = {Bridging the Gap between Pre-Training and Fine-Tuning for End-to-End Speech Translation},
author = {Chengyi Wang and Yu Wu and Shujie Liu and Zhenglu Yang and Ming Zhou},
journal= {arXiv preprint arXiv:1909.07575},
year = {2019}
}
备注
AAAI2020