中文

文本引导的 HuBERT:通过生成对抗网络进行自监督语音预训练

音频与语音处理 2024-08-06 v5

摘要

人类语言可以以书面形式或口头形式表达,即文本或语音。人类可以从文本中获取知识来改进说话和倾听。然而,面向利用未配对文本的语音预训练模型的探索仅刚刚开始。本文我们研究了一种新方法,用于预训练这种联合语音-文本模型以学习增强的语音表示并惠及各种语音相关下游任务。具体而言,我们提出了一种新型预训练方法,称为文本引导的 HuBERT(T-HuBERT),该方法通过生成对抗网络(GAN)对语音进行自监督学习以派生出类似音素的离散表示。这些类似音素的伪标签序列首先通过 GAN 从语音中派生出来,以与来自额外未配对文本数据的标签序列在统计上相似。如此,我们在无监督方式中在未配对语音和文本之间架起了桥梁。广泛的实验表明,我们提出的方法在各种强基准测试中显著优于先前方法,在 LibriSpeech 数据集上实现最高可达 15.3% 的相对词错误率(WER)降低。

关键词

引用

@article{arxiv.2402.15725,
  title  = {Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks},
  author = {Duo Ma and Xianghu Yue and Junyi Ao and Xiaoxue Gao and Haizhou Li},
  journal= {arXiv preprint arXiv:2402.15725},
  year   = {2024}
}

备注

5 pages, 1 figures,5 tables, accepted by IEEE Signal Processing Letters(SPL)