ML-SUPERB:多语言语音通用性能基准
声音
2025-02-25 v3 计算与语言
音频与语音处理
摘要
语音处理通用性能基准(SUPERB)是一个用于评估自监督学习(SSL)模型在各种语音处理任务上性能的排行榜。然而,SUPERB 在其评估中主要考虑英语语音。本文提出多语言 SUPERB(ML-SUPERB),涵盖 143 种语言(从资源丰富的语言到濒危语言),并同时考虑自动语音识别与语言识别。遵循 SUPERB 的理念,ML-SUPERB 利用冻结的 SSL 特征,并通过学习一个浅层下游模型来构建多语言任务的简单框架。与 SUPERB 基准类似,我们发现语音 SSL 模型相比 FBANK 特征能显著提升性能。此外,我们发现多语言模型并非总是优于其单语对应模型。我们将发布 ML-SUPERB 作为一个包含已整理数据集和可复现训练脚本的挑战赛,以推动未来的多语言表征研究。
引用
@article{arxiv.2305.10615,
title = {ML-SUPERB: Multilingual Speech Universal PERformance Benchmark},
author = {Jiatong Shi and Dan Berrebbi and William Chen and Ho-Lam Chung and En-Pei Hu and Wei Ping Huang and Xuankai Chang and Shang-Wen Li and Abdelrahman Mohamed and Hung-yi Lee and Shinji Watanabe},
journal= {arXiv preprint arXiv:2305.10615},
year = {2025}
}
备注
Accepted by Interspeech