迈向对多语言端到端语音翻译的深入理解
计算与语言
2023-11-01 v1
摘要
在本文中,我们采用奇异值典型相关分析(SVCCA)来分析在 22 种语言上训练的多语言端到端语音翻译模型所学到的表示。SVCCA 使我们能够估计跨语言和跨层的表示相似性,增进我们对多语言语音翻译功能及其与多语言神经机器翻译潜在联系的理解。该多语言语音翻译模型在 CoVoST 2 数据集上以所有可能方向进行训练,我们利用 LASER 提取平行双语文本数据用于 SVCCA 分析。我们从分析中得出三个主要发现:(I)当某一特定语言的训练数据有限时,语言相似性在多语言语音翻译中失去效用。(II)增强的编码器表示和良好对齐的音频-文本数据显著提升了翻译质量,在训练数据未受损害时超越双语对应模型。(III)多语言语音翻译的编码器表示在语言类型学预测中预测语音特征方面表现出更优性能。基于这些发现,我们提出,解除低资源语言数据有限的约束并随后将其与语言相关的高资源语言结合,可提供一种更有效的多语言端到端语音翻译方法。
引用
@article{arxiv.2310.20456,
title = {Towards a Deep Understanding of Multilingual End-to-End Speech Translation},
author = {Haoran Sun and Xiaohu Zhao and Yikun Lei and Shaolin Zhu and Deyi Xiong},
journal= {arXiv preprint arXiv:2310.20456},
year = {2023}
}
备注
Accepted to Findings of EMNLP 2023