通过跨模态多粒度对比学习改进语音翻译
计算与语言
2023-04-21 v1 计算机视觉与模式识别
摘要
端到端语音翻译(E2E-ST)模型因其低延迟和较少的错误传播已逐渐成为主流范式。然而,由于任务复杂性和数据稀缺性,训练好这样的模型并非易事。语音与文本模态的差异导致 E2E-ST 模型性能通常劣于相应的机器翻译(MT)模型。基于上述观察,现有方法常使用共享机制通过施加各种约束来进行隐式知识迁移。然而,最终模型在 MT 任务上往往表现不如单独训练的 MT 模型,这意味着该方法的知识迁移能力也有限。为解决这些问题,我们提出用于 E2E-ST 的 FCCL(细粒度与粗粒度对比学习)方法,通过跨模态多粒度对比学习实现显式知识迁移。我们方法的一个关键要素是在句子级和帧级同时应用对比学习,为提取包含丰富语义信息的语音表征提供全面指导。此外,我们采用简单的白化方法缓解 MT 模型中的表征退化,后者会对对比学习产生不利影响。在 MuST-C 基准上的实验表明,我们提出的方法在所有八个语言对上显著优于最先进的 E2E-ST 基线。进一步分析表明,FCCL 能够将其容量从学习语法结构信息中释放出来,并迫使更多层学习语义信息。
引用
@article{arxiv.2304.10309,
title = {Improving Speech Translation by Cross-Modal Multi-Grained Contrastive Learning},
author = {Hao Zhang and Nianwen Si and Yaqi Chen and Wenlin Zhang and Xukui Yang and Dan Qu and Wei-Qiang Zhang},
journal= {arXiv preprint arXiv:2304.10309},
year = {2023}
}