信息局部性作为神经语言模型的归纳偏置
计算与语言
2025-06-06 v1
摘要
归纳偏置是每种机器学习系统的内在属性,塑造了模型如何从有限数据中泛化。在神经语言模型(LM)的情况下,关于这些偏置是否与人类处理约束一致仍存在争议。为解决此问题,我们提出了一个定量框架,允许对这些偏置的性质进行受控的调查。在我们的框架中,我们引入 -局部熵——一种从平均有损情境惊讶值推导的资讯论度量——捕捉语言的局部不确定性,通过量化 个前导符号如何有效消除下一个符号的不确定性。在 perturbed 自然语言语料库和由概率有限状态自动机(PFSA)定义的语言中进行实验,我们展示,具有更高 -局部熵的语言更难被 Transformer 和 LSTM LM 学习。这些结果表明,神经 LM 像人类一样,对语言的局部统计结构高度敏感。
关键词
引用
@article{arxiv.2506.05136,
title = {Information Locality as an Inductive Bias for Neural Language Models},
author = {Taiga Someya and Anej Svete and Brian DuSell and Timothy J. O'Donnell and Mario Giulianelli and Ryan Cotterell},
journal= {arXiv preprint arXiv:2506.05136},
year = {2025}
}