中文

Granary:25种欧洲语言的语音识别与翻译数据集

计算与语言 2025-05-22 v2 音频与语音处理

摘要

多任务和多语言方法有利于大型模型,但低资源语言的语音处理由于数据稀缺仍然探索不足。为了解决这一问题,我们推出了 Granary,一个涵盖 25 种欧洲语言的语音识别与翻译大规模语音数据集集合。这是首次在如此规模上同时进行的转录和翻译开源工作。我们通过包含分割、双推理、幻觉过滤和标点恢复的伪标注流水线来提升数据质量。我们进一步使用 EuroLLM 从伪标注转录中生成翻译对,随后经过数据过滤流水线。为提高效率,我们的流水线可在数小时内处理海量数据。我们通过在先前精心策划的数据集上比较模型在高低资源语言上的性能来评估基于处理后数据训练的模型。我们的结果表明,这些模型使用约 50% 更少的数据即可达到相似的性能。数据集将在 https://hf.co/datasets/nvidia/Granary 上发布。

关键词

引用

@article{arxiv.2505.13404,
  title  = {Granary: Speech Recognition and Translation Dataset in 25 European Languages},
  author = {Nithin Rao Koluguri and Monica Sekoyan and George Zelenfroynd and Sasha Meister and Shuoyang Ding and Sofia Kostandian and He Huang and Nikolay Karpov and Jagadeesh Balam and Vitaly Lavrukhin and Yifan Peng and Sara Papi and Marco Gaido and Alessio Brutti and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2505.13404},
  year   = {2025}
}

备注

Accepted at Interspeech 2025 v2: Added links