循环神经网络中语言形式与功能的表征
计算与语言
2016-06-09 v2 机器学习
摘要
我们提出了从语言学视角分析RNNs激活模式的新方法,并探索它们学习的语言结构类型。作为一个案例研究,我们采用一个多任务门控循环网络架构,该架构由两条并行通路组成,具有共享词嵌入,训练用于预测与输入句子对应的视觉场景表征,以及预测同一句子中的下一个词。基于我们提出的估计输入中单个词元对网络最终预测贡献量的方法,我们表明图像预测通路:a) 对句子的信息结构敏感;b) 选择性关注携带语义信息的词汇范畴和语法功能;c) 学会根据同一输入词元在句子中的语法功能不同而区别对待。相比之下,语言模型对具有句法功能的词相对更敏感。此外,我们提出探索RNNs中单个隐藏单元功能的方法,并表明案例研究中该架构的两条通路包含专门调整至对任务有信息量的模式的特殊单元,其中一些能将激活传递至后续时间步以编码长期依赖。
引用
@article{arxiv.1602.08952,
title = {Representation of linguistic form and function in recurrent neural networks},
author = {Ákos Kádár and Grzegorz Chrupała and Afra Alishahi},
journal= {arXiv preprint arXiv:1602.08952},
year = {2016}
}