KIT 面向 IWSLT 2025 的低资源语音翻译系统:基于合成数据与模型正则化的系统增强
计算与语言
2026-01-29 v2 人工智能
摘要
本文介绍了 KIT 向 IWSLT 2025 低资源赛道提交的系统。针对 Bemba、北黎凡特阿拉伯语和突尼斯阿拉伯语到英语三个语言对,我们开发了级联系统(由自动语音识别 (ASR) 和机器翻译 (MT) 模型组成)以及端到端 (E2E) 语音翻译 (ST) 系统。在预训练模型的基础上,我们采用不同策略对系统进行微调,以高效利用资源。本研究进一步探索了利用合成数据和模型正则化进行系统增强。具体而言,我们通过使用 MT 模型从 ASR 数据生成翻译来研究 MT 增强的 ST。对于缺乏平行 ST 训练数据的北黎凡特阿拉伯语,仅使用合成数据训练的系统略微超越了使用真实数据训练的级联系统。我们还探索了使用文本到语音模型从 MT 数据生成合成语音的增强方法,展示了合成数据在提升 Bemba 的 ASR 和 ST 性能方面的优势。此外,我们应用内部蒸馏来增强模型性能。实验表明,该方法在 ASR、MT 和 ST 任务以及不同的预训练模型上均能持续改善结果。最后,我们应用最小贝叶斯风险解码来结合级联系统和端到端系统,实现了约 1.5 个 BLEU 点的提升。
引用
@article{arxiv.2505.19679,
title = {KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization},
author = {Zhaolin Li and Yining Liu and Danni Liu and Tuan Nam Nguyen and Enes Yavuz Ugan and Tu Anh Dinh and Carlos Mullov and Alexander Waibel and Jan Niehues},
journal= {arXiv preprint arXiv:2505.19679},
year = {2026}
}