中文

MauBERT:面向少量样本的声学单元发现的通用语音特征归纳偏置

计算与语言 2025-12-23 v1 音频与语音处理

摘要

本文介绍 MauBERT,这是一种对 HuBERT 的多语言扩展,利用语音发音特征实现对跨语言语音表示的稳健学习.我们在 55 种语言上继续进行 HuBERT 预训练,通过语音特征到语音发音特征的映射进行监督.我们的模型从多语言数据中学习,以预测语音发音特征或音素,从而获得跨语言的无语言依赖表示,捕捉多语言语音属性.通过全面对比可辨识性测试,我们表明 MauBERT 模型比当前最先进的多语言自监督学习模型产生更具上下文不变性的表示.此外,模型能够有效适应未见语言和口语,只需进行少量自监督微调(仅需 10 小时语音).这建立了一种有效的方法,在自监督语音模型中植入语言归纳偏置.

关键词

引用

@article{arxiv.2512.19612,
  title  = {MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery},
  author = {Angelo Ortiz Tandazo and Manel Khentout and Youssef Benchekroun and Thomas Hueber and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2512.19612},
  year   = {2025}
}