中文

推动零样本端到端语音翻译的极限

计算与语言 2024-06-07 v2

摘要

数据稀缺以及语音和文本模态之间的模态差距是端到端语音翻译(ST)系统的两大主要障碍,从而阻碍了其性能。先前的工作试图通过利用外部机器翻译(MT)数据和优化拉近语音-文本表示的距离度量来缓解这些挑战。然而,取得有竞争力的结果通常需要一些ST数据。为此,我们引入了ZeroSwot,一种用于零样本ST的方法,它在没有任何配对ST数据的情况下弥合了模态差距。利用新颖的CTC压缩和最优传输,我们仅使用ASR数据训练一个语音编码器,使其与大规模多语言MT模型的表示空间对齐。该语音编码器在推理时无缝集成到MT模型中,实现了从语音到文本的直接翻译,覆盖MT模型支持的所有语言。我们的实验表明,我们可以在没有ST数据的情况下有效弥合模态差距,同时我们在MuST-C和CoVoST上的结果证明了我们的方法不仅优于先前的零样本模型,而且优于有监督模型,取得了最先进的结果。

关键词

引用

@article{arxiv.2402.10422,
  title  = {Pushing the Limits of Zero-shot End-to-End Speech Translation},
  author = {Ioannis Tsiamas and Gerard I. Gállego and José A. R. Fonollosa and Marta R. Costa-jussà},
  journal= {arXiv preprint arXiv:2402.10422},
  year   = {2024}
}

备注

ACL 2024 (Findings)