利用扩散 GAN 增强无监督语音识别
计算与语言
2023-03-27 v1 机器学习
声音
音频与语音处理
摘要
我们通过扩散-GAN 增强了用于无监督自动语音识别(ASR)的朴素对抗训练方法。我们的模型(1)将不同强度的实例噪声注入生成器输出与从未标注参考文本(由带长度约束的预训练音素语言模型采样得到)中,(2)要求依赖于扩散时间步的判别器将其分离,(3)反向传播梯度以更新生成器。在 Librispeech(test-clean 为 3.1%,test-other 为 5.6%)、TIMIT 和 MLS 数据集上与 wav2vec-U 的词/音素错误率比较表明,我们的增强策略有效。
引用
@article{arxiv.2303.13559,
title = {Enhancing Unsupervised Speech Recognition with Diffusion GANs},
author = {Xianchao Wu},
journal= {arXiv preprint arXiv:2303.13559},
year = {2023}
}
备注
5 pages, 1 figure, accepted by ICASSP 2023