推动零样本端到端语音翻译的极限
计算与语言
2024-06-07 v2
摘要
数据稀缺以及语音和文本模态之间的模态差距是端到端语音翻译(ST)系统的两大主要障碍,从而阻碍了其性能。先前的工作试图通过利用外部机器翻译(MT)数据和优化拉近语音-文本表示的距离度量来缓解这些挑战。然而,取得有竞争力的结果通常需要一些ST数据。为此,我们引入了ZeroSwot,一种用于零样本ST的方法,它在没有任何配对ST数据的情况下弥合了模态差距。利用新颖的CTC压缩和最优传输,我们仅使用ASR数据训练一个语音编码器,使其与大规模多语言MT模型的表示空间对齐。该语音编码器在推理时无缝集成到MT模型中,实现了从语音到文本的直接翻译,覆盖MT模型支持的所有语言。我们的实验表明,我们可以在没有ST数据的情况下有效弥合模态差距,同时我们在MuST-C和CoVoST上的结果证明了我们的方法不仅优于先前的零样本模型,而且优于有监督模型,取得了最先进的结果。
引用
@article{arxiv.2402.10422,
title = {Pushing the Limits of Zero-shot End-to-End Speech Translation},
author = {Ioannis Tsiamas and Gerard I. Gállego and José A. R. Fonollosa and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2402.10422},
year = {2024}
}
备注
ACL 2024 (Findings)