基于弱标签数据的低资源语言端到端语音翻译
计算与语言
2025-06-23 v1 音频与语音处理
摘要
高质量标注数据的稀缺性是开发有效端到端语音到文本翻译(ST)系统的主要挑战,尤其是针对低资源语言。本文探讨了弱标签数据可用于构建低资源语言对 ST 模型的假设。我们利用最先进的句子编码器进行比特文本挖掘,构建了语音到文本翻译数据集。我们从多语言 Shrutilipi 语料库中挖掘数据,以构建 Shrutilipi-anuvaad 数据集,涵盖孟加拉-印地语、马拉雅拉姆-印地语、奥利亚-印地语和泰卢固-印地语等语言对的 ST 数据。我们创建了多个训练数据版本,具有不同的质量和数量,以探讨弱标签数据质量与数量对 ST 模型性能的影响。结果表明,可使用弱标签数据构建 ST 系统,其性能相当于诸如 SONAR 和 SeamlessM4T 等大型多模态多语言基线模型。
引用
@article{arxiv.2506.16251,
title = {End-to-End Speech Translation for Low-Resource Languages Using Weakly Labeled Data},
author = {Aishwarya Pothula and Bhavana Akkiraju and Srihari Bandarupalli and Charan D and Santosh Kesiraju and Anil Kumar Vuppala},
journal= {arXiv preprint arXiv:2506.16251},
year = {2025}
}