面向自动语音翻译的改进跨语言迁移学习
计算与语言
2024-01-26 v4 人工智能
音频与语音处理
信号处理
摘要
多语言语音到文本翻译的研究是当前的热点。拥有一个支持多种翻译任务的单一模型是令人向往的。本工作的目标是通过语义知识蒸馏来改进多语言语音到文本翻译中的跨语言迁移学习。我们表明,通过使用 SAMU-XLS-R(一种通过多模态(语音-文本)语义知识蒸馏训练的多语言语音 Transformer 编码器)来初始化编码器-解码器序列到序列翻译模型的编码器,我们实现了比基线 XLS-R(一种通过自监督学习训练的多语言语音 Transformer 编码器)显著更好的跨语言任务知识迁移。我们在两个流行的数据集(即 CoVoST-2 和 Europarl)上展示了我们方法的有效性。在 CoVoST-2 基准测试的 21 项翻译任务中,我们比基线平均提高了 12.8 个 BLEU 值。在零样本翻译场景中,我们在未见过的中等和低资源语言上分别平均获得了 18.8 和 11.9 个 BLEU 值的提升。我们在 Europarl 语音翻译基准测试中观察到了类似的结果。
引用
@article{arxiv.2306.00789,
title = {Improved Cross-Lingual Transfer Learning For Automatic Speech Translation},
author = {Sameer Khurana and Nauman Dawalatabad and Antoine Laurent and Luis Vicente and Pablo Gimeno and Victoria Mingote and James Glass},
journal= {arXiv preprint arXiv:2306.00789},
year = {2024}
}