神经网络中用于抽象模式学习与语言建模的关系权重先验
计算与语言
2021-03-11 v1 人工智能
机器学习
摘要
深度神经网络已成为自然语言处理(NLP)中的主导方法。然而,近年来已明显看出其在系统性方面存在缺陷,限制了深度学习在NLP中的性能和数据效率。这些缺陷可在较低层次的人工任务中清晰展现,大多基于合成数据。抽象模式是神经网络在泛化到未见过的数据方面最难问题的著名例子。它们由条目间的关系(如相等性)而非其值定义。有人认为这些低层次问题展示了神经网络无法系统性学习。在本研究中,我们提出嵌入式基于关系的模式(ERBP)作为一种新颖方式,创建一种关系归纳偏置,鼓励学习抽象模式的相等性和基于距离的关系。ERBP基于基于关系的模式(RBP),但建模为网络权重上的贝叶斯先验,并作为标准网络学习中其他情况下的正则化项实现。ERBP易于集成到标准神经网络中且不影响其学习能力。在我们的实验中,ERBP先验在从合成无噪声序列学习抽象模式时带来几乎完美的泛化。ERBP还提升了自然语言模型在词和字符级别以及使用RNN、GRU和LSTM网络的旋律音高预测。我们还发现其在图编辑距离学习和组合句子蕴含等更复杂任务中的改进。ERBP持续优于RBP和标准网络,表明其实现了抽象模式学习,有助于自然语言任务的性能。
引用
@article{arxiv.2103.06198,
title = {Relational Weight Priors in Neural Networks for Abstract Pattern Learning and Language Modelling},
author = {Radha Kopparti and Tillman Weyde},
journal= {arXiv preprint arXiv:2103.06198},
year = {2021}
}
备注
29 pages