中文

利用扩散 GAN 增强无监督语音识别

计算与语言 2023-03-27 v1 机器学习 声音 音频与语音处理

摘要

我们通过扩散-GAN 增强了用于无监督自动语音识别(ASR)的朴素对抗训练方法。我们的模型(1)将不同强度的实例噪声注入生成器输出与从未标注参考文本(由带长度约束的预训练音素语言模型采样得到)中,(2)要求依赖于扩散时间步的判别器将其分离,(3)反向传播梯度以更新生成器。在 Librispeech(test-clean 为 3.1%,test-other 为 5.6%)、TIMIT 和 MLS 数据集上与 wav2vec-U 的词/音素错误率比较表明,我们的增强策略有效。

关键词

引用

@article{arxiv.2303.13559,
  title  = {Enhancing Unsupervised Speech Recognition with Diffusion GANs},
  author = {Xianchao Wu},
  journal= {arXiv preprint arXiv:2303.13559},
  year   = {2023}
}

备注

5 pages, 1 figure, accepted by ICASSP 2023