中文

ML-SUPERB 2.0:跨建模约束、语言与数据集的多语言语音模型基准测试

声音 2024-06-14 v1 计算与语言 音频与语音处理

摘要

ML-SUPERB 对自监督学习 (SSL) 模型进行评估,评估任务包括语言识别和自动语音识别 (ASR)。该基准将模型用作特征提取器,并使用单个浅层下游模型,该模型可以针对下游任务进行微调。然而,实际应用场景可能需要不同的配置。本文提出了 ML-SUPERB~2.0,这是一个用于评估预训练 SSL 和监督语音模型的新基准,涵盖下游模型、微调设置以及高效模型适应方法。我们发现相较于 ML-SUPERB 的设置,性能有所提升。但性能取决于下游模型的设计。我们还发现语言和数据集之间的性能差异较大,表明需要更有针对性的方法来提高多语言 ASR 性能。

关键词

引用

@article{arxiv.2406.08641,
  title  = {ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets},
  author = {Jiatong Shi and Shih-Heng Wang and William Chen and Martijn Bartelds and Vanya Bannihatti Kumar and Jinchuan Tian and Xuankai Chang and Dan Jurafsky and Karen Livescu and Hung-yi Lee and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2406.08641},
  year   = {2024}
}

备注

Accepted by Interspeech 2024