TalTech 系统用于 Interspeech 2025 ML-SUPERB 2.0 挑战赛
计算与语言
2025-06-03 v1 音频与语音处理
摘要
本文描述了为 Interspeech 2025 ML-SUPERB 2.0 挑战赛而在塔林理工大学开发的语种识别与多语言语音识别系统。该系统采用混合语种识别系统,由一个预训练语言嵌入模型和一个轻量级语音识别模型组成,后者在各语言间共享编码器并使用特定语言的双元语言模型。对于语音识别,使用了三个模型,其中每种语言仅应用单一模型,具体取决于训练数据的可用性及在留出数据上的性能。模型集合包括 SeamlessM4T 的微调版本、带有自定义语言适配器的 MMS-1B-all 以及 MMS-zeroshot。该系统在挑战赛中获得了总分第一名。
引用
@article{arxiv.2506.01458,
title = {TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge},
author = {Tanel Alumäe and Artem Fedorchenko},
journal= {arXiv preprint arXiv:2506.01458},
year = {2025}
}
备注
Accepted to Interspeech 2025