基于预训练 ASR 模型改进低资源语音到文本翻译的策略
代数几何
2024-11-12 v3
摘要
本文提出用于改进低资源语音到文本翻译(ST)性能的技术与发现。我们在模拟低资源与真实低资源两种设置下分别进行了实验,语言对为英语-葡萄牙语与塔马舍克语-法语。使用 ST 的编码器-解码器框架,我们的结果表明多语言自动语音识别系统在低资源场景下可作为良好的初始化。此外,在训练与解码时将 CTC 作为翻译的附加目标有助于重排内部表示并改善最终翻译。通过实验,我们试图辨识对低资源设置下改进贡献最大的各类因素(初始化、目标与超参数)。仅用 300 小时预训练数据,我们的模型在塔马舍克语-法语数据上取得了 7.3 的 BLEU 分数,以 1.6 分超越 IWSLT 2022 已发表工作。
引用
@article{arxiv.2306.00207,
title = {Birational geometry of Calabi-Yau pairs and 3-dimensional Cremona transformations},
author = {Carolina Araujo and Alessio Corti and Alex Massarenti},
journal= {arXiv preprint arXiv:2306.00207},
year = {2024}
}
备注
This is a major revision containing a revised Section 4.2, adding detail to several proofs, and correcting several mistakes and many typos. We thank a careful anonymous referee for making many suggestions for improvement, on which this revision is based