中文

Maestro-U:利用联合语音-文本表示学习实现零监督语音 ASR

计算与语言 2022-10-24 v2 声音 音频与语音处理

摘要

训练最先进的自动语音识别(ASR)模型通常需要大量转写语音。本文中,我们展示了可以利用模态匹配的联合语音与文本模型,在某些语言没有任何监督(人工转写)语音的情况下训练大规模多语言 ASR 模型。本文探索在大规模多语言、零监督语音的真实场景中使用联合学习的语音与文本表示,仅借助目标语言的无标注语音和文本来扩展 ASR 所覆盖的语言集合。使用 FLEURS 数据集,我们定义该任务覆盖 102102 种语言,其中 5252 种语言有转写语音可用,可用于提升其余 5050 种语言的端到端 ASR 质量。首先,我们表明通过结合语音表示与字节级文本表示并使用语言嵌入,可将无监督语音语言的字符错误率(CER)从 64.8% 大幅降至 30.8%,相对降低 53%。其次,使用南亚语言子集,我们展示了 Maestro-U 即便在字位重叠有限乃至为零时,也能促进来自有监督语音语言的知识迁移。总体而言,Maestro-U 将相对于预言机性能的差距相对缩小了 68.5%,并使 19 种语言的 CER 降至 15% 以下。

关键词

引用

@article{arxiv.2210.10027,
  title  = {Maestro-U: Leveraging joint speech-text representation learning for zero supervised speech ASR},
  author = {Zhehuai Chen and Ankur Bapna and Andrew Rosenberg and Yu Zhang and Bhuvana Ramabhadran and Pedro Moreno and Nanxin Chen},
  journal= {arXiv preprint arXiv:2210.10027},
  year   = {2022}
}

备注

Accepted by SLT 2022