可视化与“诊断分类器”揭示递归与递归神经网络如何处理层次结构
计算与语言
2018-04-23 v2
摘要
我们研究神经网络如何学习并处理具有层次化、组合性语义的语言。为此,我们定义了处理嵌套算术表达式这一人工任务,并研究不同类型的神经网络能否学习计算其含义。我们发现递归神经网络能找到该问题的泛化解,并通过将其分解为三步——投影、求和与压缩——来可视化该解。下一步,我们研究递归神经网络,并表明门控循环单元(gated recurrent unit)以增量方式处理输入时,在此任务上也表现极佳。为理解递归网络所编码的内容,仅可视化技术并不足够。因此,我们开发了一种方法,其中我们提出并检验关于网络编码与处理的多个假设。对于每个假设,我们推导出关于每时间步隐状态表示特征的预测,并训练“诊断分类器”来检验这些预测。我们的结果表明,网络遵循类似于我们假设的“累积策略”的策略,这解释了网络在新表达式上的高准确率、对长于训练所见表达式的泛化能力,以及随长度增加的轻微退化。这反过来表明诊断分类器可成为打开神经网络黑箱的有用技术。我们认为,与多数可视化技术不同,诊断分类可从小型网络在玩具域中扩展到处理真实数据的大型更深递归网络,并因此有助于更好地理解当前自然语言处理中最先进模型的内部动态。
引用
@article{arxiv.1711.10203,
title = {Visualisation and 'diagnostic classifiers' reveal how recurrent and recursive neural networks process hierarchical structure},
author = {Dieuwke Hupkes and Sara Veldhoen and Willem Zuidema},
journal= {arXiv preprint arXiv:1711.10203},
year = {2018}
}
备注
20 pages