神经语言模型的时间尺度组织映射
计算与语言
2021-03-19 v2
摘要
在人脑中,语言输入序列在一个分布式、分层架构中被处理,其中更高处理阶段在更长的时间尺度上编码上下文信息。相比之下,在执行自然语言处理的循环神经网络中,我们对多时间尺度上下文信息如何功能组织知之甚少。因此,我们应用神经科学中开发的工具来映射词级LSTM语言模型内各单元的“处理时间尺度”。该时间尺度映射方法将长时间尺度分配给先前发现追踪长距离句法依赖的单元。此外,映射揭示了网络中一小部分(少于15%的单元)具有长时间尺度且其功能此前未被探究。我们接着通过考察单元的处理时间尺度与其网络连接性之间的关系来探查网络的功能组织。我们识别出两类长时间尺度单元:“控制器”单元构成一个密集互连子网络并强烈投射到网络其余部分,而“积分器”单元展现出网络中最长的时间尺度,并表现出接近平均投射剖面的投射剖面。消融积分器和控制器单元影响了模型在句子内不同位置上的表现,表明这两组单元具有不同功能。最后,我们测试了这些结果向字符级LSTM模型及不同架构模型的泛化能力。总之,我们展示了一种无模型技术用于映射循环神经网络中的时间尺度组织,并应用该方法揭示了神经语言模型的时间尺度和功能组织。
引用
@article{arxiv.2012.06717,
title = {Mapping the Timescale Organization of Neural Language Models},
author = {Hsiang-Yun Sherry Chien and Jinhan Zhang and Christopher. J. Honey},
journal= {arXiv preprint arXiv:2012.06717},
year = {2021}
}
备注
23 pages, 4 main figures, 10 appendix figures; published as a conference paper at ICLR 2021