Articulation GAN:发音学习的无监督建模
声音
2023-05-10 v2 人工智能
计算与语言
音频与语音处理
摘要
生成式深度神经网络被广泛用于语音合成,但大多数现有模型直接生成波形或频谱输出。然而,人类通过控制发音器官产生语音,从而通过声音传播的物理特性产生语音声音。我们将发音生成器引入生成对抗网络 (GAN) 范式,这是一种新的语音产生/合成的无监督生成模型。发音生成器通过以完全无监督的方式学习生成发音表征(电磁发音仪或 EMA),更紧密地模仿人类语音产生。一个单独的预训练物理模型 (ema2wav) 随后将生成的 EMA 表征转换为语音波形,并将其发送给判别器进行评估。发音分析表明,在语音产生过程中,网络学会了以类似于人类的方式控制发音器官。对输出的声学分析表明,网络学会了生成训练分布中存在和不存在的单词。我们还讨论了发音表征对人类语言认知模型及语音技术的普遍意义。
引用
@article{arxiv.2210.15173,
title = {Articulation GAN: Unsupervised modeling of articulatory learning},
author = {Gašper Beguš and Alan Zhou and Peter Wu and Gopala K Anumanchipalli},
journal= {arXiv preprint arXiv:2210.15173},
year = {2023}
}
备注
ICASSP 2023