中文

信息局部性作为神经语言模型的归纳偏置

计算与语言 2025-06-06 v1

摘要

归纳偏置是每种机器学习系统的内在属性,塑造了模型如何从有限数据中泛化。在神经语言模型(LM)的情况下,关于这些偏置是否与人类处理约束一致仍存在争议。为解决此问题,我们提出了一个定量框架,允许对这些偏置的性质进行受控的调查。在我们的框架中,我们引入 mm-局部熵\unicodex2013\unicode{x2013}——一种从平均有损情境惊讶值\unicodex2013\unicode{x2013}推导的资讯论度量——捕捉语言的局部不确定性,通过量化 m1m-1 个前导符号如何有效消除下一个符号的不确定性。在 perturbed 自然语言语料库和由概率有限状态自动机(PFSA)定义的语言中进行实验,我们展示,具有更高 mm-局部熵的语言更难被 Transformer 和 LSTM LM 学习。这些结果表明,神经 LM 像人类一样,对语言的局部统计结构高度敏感。

关键词

引用

@article{arxiv.2506.05136,
  title  = {Information Locality as an Inductive Bias for Neural Language Models},
  author = {Taiga Someya and Anej Svete and Brian DuSell and Timothy J. O'Donnell and Mario Giulianelli and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2506.05136},
  year   = {2025}
}