文本引导的 HuBERT:通过生成对抗网络进行自监督语音预训练
音频与语音处理
2024-08-06 v5
摘要
人类语言可以以书面形式或口头形式表达,即文本或语音。人类可以从文本中获取知识来改进说话和倾听。然而,面向利用未配对文本的语音预训练模型的探索仅刚刚开始。本文我们研究了一种新方法,用于预训练这种联合语音-文本模型以学习增强的语音表示并惠及各种语音相关下游任务。具体而言,我们提出了一种新型预训练方法,称为文本引导的 HuBERT(T-HuBERT),该方法通过生成对抗网络(GAN)对语音进行自监督学习以派生出类似音素的离散表示。这些类似音素的伪标签序列首先通过 GAN 从语音中派生出来,以与来自额外未配对文本数据的标签序列在统计上相似。如此,我们在无监督方式中在未配对语音和文本之间架起了桥梁。广泛的实验表明,我们提出的方法在各种强基准测试中显著优于先前方法,在 LibriSpeech 数据集上实现最高可达 15.3% 的相对词错误率(WER)降低。
引用
@article{arxiv.2402.15725,
title = {Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks},
author = {Duo Ma and Xianghu Yue and Junyi Ao and Xiaoxue Gao and Haizhou Li},
journal= {arXiv preprint arXiv:2402.15725},
year = {2024}
}
备注
5 pages, 1 figures,5 tables, accepted by IEEE Signal Processing Letters(SPL)