中文

理解用于文本分类的卷积神经网络

计算与语言 2020-04-29 v3

摘要

我们针对用于处理文本的卷积神经网络(CNNs)的内部机制展开分析。用于计算机视觉的 CNN 可通过将滤波器投影至图像空间来解释,但对于离散序列输入的 CNN 仍属未解之谜。我们旨在理解网络处理并分类文本的方法。我们考察了关于该问题的常见假设:即滤波器配合全局最大池化充当 n-gram 检测器。我们表明,滤波器可通过不同的激活模式捕捉若干不同语义类的 n-gram,且全局最大池化诱发的行为可将重要 n-gram 与其余部分分离。最后,我们基于发现给出了实际用例,形式为模型可解释性(通过为每个滤波器推导具体身份来解释训练好的模型,弥合视觉任务与 NLP 中可视化工具间的鸿沟)与预测可解释性(解释预测)。代码实现见于 github.com/sayaendo/interpreting-cnn-for-text。

关键词

引用

@article{arxiv.1809.08037,
  title  = {Understanding Convolutional Neural Networks for Text Classification},
  author = {Alon Jacovi and Oren Sar Shalom and Yoav Goldberg},
  journal= {arXiv preprint arXiv:1809.08037},
  year   = {2020}
}

备注

Accepted to "Analyzing and interpreting neural networks for NLP" workshop in EMNLP 2018. v2: Added link to online github implementation