重新思考并改进端到端语音翻译中的多任务学习
计算与语言
2023-11-08 v1 人工智能
声音
音频与语音处理
摘要
通过应用多任务学习,端到端语音翻译(ST)取得了显著改进。然而,辅助任务与 ST 任务的一致程度如何,以及该方法究竟有多大帮助,尚未被深入研究。在本文中,我们考虑不同时间与模块,研究了不同任务之间的一致性。我们发现文本编码器主要促进跨模态转换,但语音中的噪声阻碍了文本与语音表示之间的一致性。此外,我们提出了一种针对 ST 任务的改进多任务学习(IMTL)方法,通过减小长度与表示的差异来弥合模态鸿沟。我们在 MuST-C 数据集上进行了实验。结果表明,我们的方法达到了最先进的性能。此外,当使用额外数据时,我们在 MuST-C 英到西任务上以当前 SOTA 方法所需训练时间的 20.8% 取得了新的 SOTA 结果。
引用
@article{arxiv.2311.03810,
title = {Rethinking and Improving Multi-task Learning for End-to-end Speech Translation},
author = {Yuhao Zhang and Chen Xu and Bei Li and Hao Chen and Tong Xiao and Chunliang Zhang and Jingbo Zhu},
journal= {arXiv preprint arXiv:2311.03810},
year = {2023}
}
备注
Accepted to EMNLP2023 main conference