语音翻译的预训练:CTC遇见最优传输
计算与语言
2023-06-06 v3 机器学习
声音
音频与语音处理
摘要
语音与文本模态之间的鸿沟是语音到文本翻译(ST)中的主要挑战。已有多种方法被提出以缩小这一鸿沟,但其中大多数需要在ST训练中改变架构。在本工作中,我们提出在预训练阶段缓解该问题,无需改变ST模型。首先,我们表明连接主义时序分类(CTC)损失可从设计上缩小模态鸿沟。我们与更常见的交叉熵损失进行了定量比较,显示使用CTC预训练始终取得更好的最终ST精度。然而,CTC仅是部分解决方案,因此在我们的第二项贡献中,我们提出一种结合CTC与最优传输的新型预训练方法以进一步缩小该鸿沟。我们的方法预训练一个类Siamese的模型,其由两个编码器组成,一个用于声学输入,另一个用于文本输入,使得它们在Wasserstein空间中产生彼此接近的表示。在标准CoVoST-2与MuST-C数据集上的大量实验表明,我们的预训练方法应用于原生编码器-解码器Transformer在无外部数据设置下取得了最先进性能,并与近期使用外部数据训练的强多任务学习系统表现相当。最后,我们的方法也可应用于这些多任务系统之上,带来这些模型的进一步提升。代码与预训练模型可在 https://github.com/formiel/fairseq 获取。
引用
@article{arxiv.2301.11716,
title = {Pre-training for Speech Translation: CTC Meets Optimal Transport},
author = {Phuong-Hang Le and Hongyu Gong and Changhan Wang and Juan Pino and Benjamin Lecouteux and Didier Schwab},
journal= {arXiv preprint arXiv:2301.11716},
year = {2023}
}
备注
ICML 2023 (oral presentation). This version fixed URLs, updated affiliations & acknowledgements, and improved formatting