面向语音翻译任务的最优多任务学习正则化视角
计算与语言
2025-09-15 v1
摘要
端到端语音到文本翻译通常因缺乏配对语音-文本数据而受限。一种克服这一不足的方法是利用机器翻译(MT)任务中的 bitext 数据并进行多任务学习(MTL)。在本文中,我们从正则化视角对 MTL 进行建模,并探讨序列如何在同一模态内以及跨模态间进行正则化。通过彻底探讨一致性正则化(不同模态)和 R-drop(相同模态)的作用,我们展示了它们分别如何为总正则化贡献。我们还演示了 MT 损失的系数在 MTL 设置中作为另一种正则化来源。有了这三种正则化来源,我们引入了高维空间中的最优正则化轮廓,称为正则化视界。实验表明,在正则化视界内调整超参数可在 MuST-C 数据集上实现接近最先进的性能。
引用
@article{arxiv.2509.09701,
title = {Optimal Multi-Task Learning at Regularization Horizon for Speech Translation Task},
author = {JungHo Jung and Junhyun Lee},
journal= {arXiv preprint arXiv:2509.09701},
year = {2025}
}