中文

分形模式可能揭示下一个词预测的成功

计算与语言 2024-05-24 v2 人工智能

摘要

我们研究语言的分形结构,旨在提供一个精确的形式化方法来量化可能之前被怀疑但未正式证明的性质。我们确定语言是:(1)自相似的,在所有粒度级别上表现出复杂性,没有特定的特征上下文长度;(2)长程依赖(LRD),Hurst参数约为H=0.7。基于这些发现,我们认为语言中的短期模式/依赖(例如段落)反映了更大范围(如整个文档)的模式/依赖。这可能有助于阐明下一个词预测如何捕捉文本在多个粒度级别上的结构,从单词和从句到更广泛的上下文和意图。此外,我们跨不同领域和架构进行了广泛分析,表明分形参数是稳健的。最后,我们证明在LLM中观察到的分形参数的微小变化在预测其下游性能方面优于基于困惑度的每字节比特数(BPB)。我们希望这些发现能为语言和LLM成功背后的机制提供新的视角。

关键词

引用

@article{arxiv.2402.01825,
  title  = {Fractal Patterns May Illuminate the Success of Next-Token Prediction},
  author = {Ibrahim Alabdulmohsin and Vinh Q. Tran and Mostafa Dehghani},
  journal= {arXiv preprint arXiv:2402.01825},
  year   = {2024}
}

备注

15 pages, 10 tables, 6 figures