中文

TalTech 系统用于 Interspeech 2025 ML-SUPERB 2.0 挑战赛

计算与语言 2025-06-03 v1 音频与语音处理

摘要

本文描述了为 Interspeech 2025 ML-SUPERB 2.0 挑战赛而在塔林理工大学开发的语种识别与多语言语音识别系统。该系统采用混合语种识别系统,由一个预训练语言嵌入模型和一个轻量级语音识别模型组成,后者在各语言间共享编码器并使用特定语言的双元语言模型。对于语音识别,使用了三个模型,其中每种语言仅应用单一模型,具体取决于训练数据的可用性及在留出数据上的性能。模型集合包括 SeamlessM4T 的微调版本、带有自定义语言适配器的 MMS-1B-all 以及 MMS-zeroshot。该系统在挑战赛中获得了总分第一名。

关键词

引用

@article{arxiv.2506.01458,
  title  = {TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge},
  author = {Tanel Alumäe and Artem Fedorchenko},
  journal= {arXiv preprint arXiv:2506.01458},
  year   = {2025}
}

备注

Accepted to Interspeech 2025