中文

哪些类型的 token 从远处文本中受益?对长上下文语言建模的分析

计算与语言 2024-06-18 v1

摘要

随着大型语言模型可处理的上下文长度不断增加,这些模型展现出增强的能力,能够利用远处信息完成诸如语言建模等任务。这种能力与人类的阅读和写作习惯形成鲜明对比,除非是预示性内容,否则不常见于记住和使用特别远处的信息。本文旨在探索哪些类型的单词在长上下文中受益最大。通过分析随上下文长度增加而变化的 token 概率,我们发现内容词(如名词、形容词)以及单词初始的 token 最能受益。上下文中的频繁模式(N-gram)也对预测具有显著影响。此外,模型的先验知识在影响预测方面起着关键作用,尤其是对于稀有 token。我们还观察到,随着上下文长度的增加,语言模型变得更加自信,导致概率分布变得更尖锐。这种过度自信可能有助于提高具有远处上下文信息的 token 的概率。我们希望我们的分析能帮助社区更好地理解长文本语言建模,并为设计更可靠的长上下文模型做出贡献。

关键词

引用

@article{arxiv.2406.11238,
  title  = {What Kinds of Tokens Benefit from Distant Text? An Analysis on Long Context Language Modeling},
  author = {Yutong Hu and Quzhe Huang and Kangcheng Luo and Yansong Feng},
  journal= {arXiv preprint arXiv:2406.11238},
  year   = {2024}
}