中文

CiwGAN与fiwGAN:在声学数据中编码信息以用生成对抗网络建模词汇学习

计算与语言 2021-07-29 v3 机器学习

摘要

深度神经网络如何能将对应于人类语音中词语的信息编码到原始声学数据中?本文提出两种用于从原始声学输入建模无监督词汇学习的神经网络架构,ciwGAN(Categorical InfoWaveGAN)和fiwGAN(Featural InfoWaveGAN),它们将用于音频数据的深度卷积GAN架构(WaveGAN; arXiv:1705.07904)与GAN的信息论扩展——InfoGAN(arXiv:1606.03657)相结合,并提出了一种新的潜空间结构,可同时建模特征学习与上一级分类,并允许以极低维向量表示词汇项。词汇学习被建模为从一种架构中涌现,该架构迫使深度神经网络输出数据,使其声学输出中可检索到唯一信息。在TIMIT的词汇项上训练的网络学会在其潜空间以类别变量的形式编码对应于词汇项的唯一信息。通过操纵这些变量,网络输出特定词汇项。网络偶尔输出违反训练数据的创新性词汇项,但在语言学上可解释,并且对认知建模和神经网络可解释性极具信息量。创新性输出表明,网络学到的语音和音系表征可被生产性重组,并直接与人类言语中的生产性平行:一个在‘suit’和‘dark’上训练的fiwGAN网络输出创新性‘start’,尽管它在训练数据中从未见过‘start’甚至[st]序列。我们还论证,将潜特征码设置为远超训练范围的值会导致几乎类别化的原型词汇项生成,并揭示每个潜码的基础值。

关键词

引用

@article{arxiv.2006.02951,
  title  = {CiwGAN and fiwGAN: Encoding information in acoustic data to model lexical learning with Generative Adversarial Networks},
  author = {Gašper Beguš},
  journal= {arXiv preprint arXiv:2006.02951},
  year   = {2021}
}

备注

Published in Neural Networks