CiwaGAN:发音器官信息交换
声音
2023-09-15 v1 人工智能
计算与语言
音频与语音处理
摘要
人类通过控制发音器官将信息编码为声音,并利用听觉装置从声音中解码信息。本文介绍 CiwaGAN,一种人类口语习得模型,它将无监督发音器官建模与通过听觉模态进行信息交换的无监督模型相结合。虽然先前研究分别包含了无监督发音器官建模和信息交换,我们的模型是首个将这两部分结合的。本文还提出了一种具有更具可解释内部表示的改进发音器官模型。所提出的 CiwaGAN 模型是使用深度学习对人类口语习得最真实的近似。因此,它可用于对人类言语行为作认知上合理的模拟。
引用
@article{arxiv.2309.07861,
title = {CiwaGAN: Articulatory information exchange},
author = {Gašper Beguš and Thomas Lu and Alan Zhou and Peter Wu and Gopala K. Anumanchipalli},
journal= {arXiv preprint arXiv:2309.07861},
year = {2023}
}