中文

无监督声学词分类中卷积中间层的可解释性分析

声音 2022-04-29 v2 计算与语言 音频与语音处理

摘要

理解深度卷积神经网络如何对数据进行分类已受到广泛研究。本文提出一种技术,通过对每个卷积层中各个特征图取平均并借助非线性回归技术推断词底层分布,来可视化并解释无监督深度卷积网络的中间层。一个基于 GAN 的架构(ciwGAN arXiv:2006.02951)包含生成器、判别器与分类器,其在来自 TIMIT 的无标签切片词汇项上训练。训练过程产生一个深度卷积网络,该网络仅从生成器输出信息性数据的要求中学习将词分类为离散类别。此分类器网络无法访问训练数据——仅能访问生成的数据。我们提出一种可视化分类器中各个卷积层的技术,其为每个卷积层生成高度信息性的时间序列数据,并将其应用于未观测的测试数据。利用非线性回归,我们推断每个词的底层分布,从而能够分析不同卷积层上各个词的绝对值与形状,并对其声学属性进行假设检验。该技术还使我们能够测试各个音段对比及其在各层的表示方式。

关键词

引用

@article{arxiv.2110.02375,
  title  = {Interpreting intermediate convolutional layers in unsupervised acoustic word classification},
  author = {Gašper Beguš and Alan Zhou},
  journal= {arXiv preprint arXiv:2110.02375},
  year   = {2022}
}

备注

ICASSP 2022