中文

mHuBERT-147:一个紧凑的多语言 HuBERT 模型

计算与语言 2024-11-22 v5 声音 音频与语音处理

摘要

我们提出了 mHuBERT-147,这是第一个在 90K 小时干净、开放许可数据上训练的通用大规模多语言 HuBERT 语音表示模型。为了扩展多迭代 HuBERT 方法,我们使用基于 faiss 的聚类,标签分配速度比原始方法快 5.2 倍。我们还应用了一种新的多语言批处理上采样策略,同时利用了语言和数据集的多样性。经过 3 次训练迭代后,我们紧凑的 95M 参数 mHuBERT-147 优于在更多数据上训练的更大模型。我们在 ML-SUPERB 10min 和 1h 排行榜上分别排名第二和第一,并在 3 项任务上取得 SOTA 分数。在 ASR/LID 任务上,我们的模型持续超越 XLS-R(300M 参数;436K 小时),并对大得多的 MMS(1B 参数;491K 小时)展现出强大的竞争力。我们的研究结果表明,mHuBERT-147 是一个有前途的多语言语音任务模型,在高性能和参数效率之间提供了前所未有的平衡。

关键词

引用

@article{arxiv.2406.06371,
  title  = {mHuBERT-147: A Compact Multilingual HuBERT Model},
  author = {Marcely Zanon Boito and Vivek Iyer and Nikolaos Lagos and Laurent Besacier and Ioan Calapodescu},
  journal= {arXiv preprint arXiv:2406.06371},
  year   = {2024}
}

备注

Extended version of the Interspeech 2024 paper of same name