中文

解释在波形上训练的生成式 CNN 的中间卷积层

声音 2022-10-21 v4 人工智能 计算与语言 音频与语音处理

摘要

本文提出一种技术,以无监督方式解释和可视化在原始语音数据上训练的生成式 CNN 的中间层。我们认为,在每个转置卷积层中 ReLU 激活后对特征图取平均可产生可解释的时间序列数据。该技术允许对中间层进行类似于人类语音数据声学分析的声学分析:我们可以从中间层提取 F0、强度、时长、共振峰和其他声学属性,以测试 CNN 在何处及如何编码各类信息。我们进一步将该技术与模型潜空间的线性插值相结合,以展示潜空间中单个变量与模型中间卷积层激活之间的因果关系。特别地,观察线性插值与其在中间层中所引发变化的因果效应,可揭示单个潜变量如何转化为中间层激活中的尖峰。我们训练并探测了两个模型的内部表示——一个裸 WaveGAN 架构和一个 ciwGAN 扩展(其迫使生成器输出信息丰富的数据,并导致语言学有意义表示的出现)。针对语音的三个基本声学属性进行解释与可视化:周期振动(对应元音)、非周期噪声振动(对应擦音)和静音(对应塞音)。该方案还允许测试更高层次的形态音系交替,如重叠(复制)。简而言之,使用所提技术,我们可以分析语音中语言学有意义的单元如何在生成式神经网络的每个卷积层中被编码。

关键词

引用

@article{arxiv.2104.09489,
  title  = {Interpreting intermediate convolutional layers of generative CNNs trained on waveforms},
  author = {Gašper Beguš and Alan Zhou},
  journal= {arXiv preprint arXiv:2104.09489},
  year   = {2022}
}

备注

IEEE/ACM Transactions on Audio Speech and Language Processing