TeluguST-46:泰卢固语-英语语音翻译的基准语料库与综合评估
计算与语言
2025-12-09 v1 音频与语音处理
摘要
尽管泰卢固语有超过 8000 万使用者,但该形态丰富语言的语音翻译研究仍然严重不足。我们通过从 46 小时人工验证的 CSTD 语料数据(训练/开发/测试集按 30h/8h/8h 划分)开发了一个高质量的泰卢固语-英语语音翻译基准。对级联架构与端到端架构的系统性比较表明,尽管 IndicWhisper + IndicMT 因使用了大量泰卢固语特定训练数据而达到最高性能,但微调的 SeamlessM4T 模型在仅使用显著更少的泰卢固语特定训练数据的情况下仍展现出显著的竞争力。这一发现表明,通过仔细的超参数调优和充足的并行数据(可能少于 100 小时),端到端系统在低资源场景下可以达到与级联方法相当的性能。我们的指标可靠性研究评估了 BLEU、METEOR、ChrF++、ROUGE-L、TER 和 BERTScore 与人工判断的一致性,结果表明传统指标对泰卢固语-英语翻译的质量判别能力优于 BERTScore。本工作提供了三项关键贡献:一个可复现的泰卢固语-英语基准、低资源场景下端到端性能具有竞争力的经验证据,以及针对形态复杂语言对的自动评估实用指南。
引用
@article{arxiv.2512.07265,
title = {TeluguST-46: A Benchmark Corpus and Comprehensive Evaluation for Telugu-English Speech Translation},
author = {Bhavana Akkiraju and Srihari Bandarupalli and Swathi Sambangi and Vasavi Ravuri and R Vijaya Saraswathi and Anil Kumar Vuppala},
journal= {arXiv preprint arXiv:2512.07265},
year = {2025}
}
备注
Submitted to AACL IJCNLP 2025