神经网络能否从原始语言数据中习得结构偏置?
计算与语言
2020-09-25 v2
摘要
我们评估了广泛用于句子处理的神经网络 BERT 是否通过在原始数据上的预训练获得了形成结构泛化的归纳偏置。我们进行了四个实验,在不同结构依赖现象中测试其对结构泛化与线性泛化的偏好。我们发现 BERT 在 4 个经验领域中的 3 个——主语-助动词倒装、反身代词约束,以及嵌入式从句中的动词时态检测——做出了结构泛化,但在 NPI 允准测试中做出了线性泛化。我们认为这些结果迄今为止是来自人工学习者支持“结构偏置可从原始数据习得”这一命题的最强证据。若此结论正确,则它提供了一些语言普遍现象可被无先天偏置的学习者习得的初步证据。然而,其对人类语言习得的确切启示尚不清楚,因为人类从远少于 BERT 的数据中学习语言。
引用
@article{arxiv.2007.06761,
title = {Can neural networks acquire a structural bias from raw linguistic data?},
author = {Alex Warstadt and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2007.06761},
year = {2020}
}
备注
To appear in Proceedings of 42nd Annual Meeting of the Cognitive Science Society