中文

利用音视频数据降低自监督语音模型的多语言差距

计算与语言 2025-09-23 v1 音频与语音处理

摘要

自监督学习 (SSL) 在语音表征学习方面取得了显著进展。如 wav2vec 2.0 和 HuBERT 等模型在语音识别等任务中取得了最新结果,尤其在单语言场景中表现突出。然而,多语言 SSL 模型在每个单个语言上往往不及其单语言对手,尤其在语言数量较少的多语言场景(如双语情境)中表现更为不足。本文通过在双语语音 SSL 模型中引入有限的视觉锚定,探索一种新方法以缩小这种性能差距。我们的结果表明,视觉锚定对单语言和双语模型均有所提益,尤其体现在后者方面,将零样本语音判别的多语言性能差距从仅含音频的模型中的 31.5% 降至 8.04%。

关键词

引用

@article{arxiv.2509.17523,
  title  = {Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models},
  author = {María Andrea Cruz Blandón and Zakaria Aldeneh and Jie Chi and Maureen de Seyssel},
  journal= {arXiv preprint arXiv:2509.17523},
  year   = {2025}
}

备注

5 pages, 2 figures