用人工语言考察神经语言模型的归纳偏置
计算与语言
2021-06-03 v1
摘要
由于语言模型被用于建模种类繁多的语言,自然会问用于该任务的神经架构是否具有对特定类型语言建模的归纳偏置。由于实验设置中出现的许多变量,对这些偏置的探究已被证明是复杂的。语言在许多类型学维度上有所不同,且很难在排除其他作为混杂因素的情况下单独挑出一两个来研究。我们提出了一种利用人工语言考察语言模型归纳偏置的新方法。这些语言被构造为允许我们创建跨语言的平行语料库,这些语言仅在所研究的类型学特征(如词序)上不同。我们随后用它们来训练和测试语言模型。这构成了一个完全受控的因果框架,并展示了语法工程如何能作为分析神经模型的有用工具。使用该方法,我们发现常用的神经架构表现出不同的归纳偏置:LSTM 对词序几乎无偏好,而 transformer 对某些语序相对于其他语序表现出明确的偏好。此外,我们发现 LSTM 与 transformer 的归纳偏置均似乎未反映我们在已证实的自然语言中看到的任何倾向。
引用
@article{arxiv.2106.01044,
title = {Examining the Inductive Bias of Neural Language Models with Artificial Languages},
author = {Jennifer C. White and Ryan Cotterell},
journal= {arXiv preprint arXiv:2106.01044},
year = {2021}
}
备注
Accepted at ACL 2021