中文

Articulation GAN:发音学习的无监督建模

声音 2023-05-10 v2 人工智能 计算与语言 音频与语音处理

摘要

生成式深度神经网络被广泛用于语音合成,但大多数现有模型直接生成波形或频谱输出。然而,人类通过控制发音器官产生语音,从而通过声音传播的物理特性产生语音声音。我们将发音生成器引入生成对抗网络 (GAN) 范式,这是一种新的语音产生/合成的无监督生成模型。发音生成器通过以完全无监督的方式学习生成发音表征(电磁发音仪或 EMA),更紧密地模仿人类语音产生。一个单独的预训练物理模型 (ema2wav) 随后将生成的 EMA 表征转换为语音波形,并将其发送给判别器进行评估。发音分析表明,在语音产生过程中,网络学会了以类似于人类的方式控制发音器官。对输出的声学分析表明,网络学会了生成训练分布中存在和不存在的单词。我们还讨论了发音表征对人类语言认知模型及语音技术的普遍意义。

关键词

引用

@article{arxiv.2210.15173,
  title  = {Articulation GAN: Unsupervised modeling of articulatory learning},
  author = {Gašper Beguš and Alan Zhou and Peter Wu and Gopala K Anumanchipalli},
  journal= {arXiv preprint arXiv:2210.15173},
  year   = {2023}
}

备注

ICASSP 2023