加法多步马尔可夫链与大语言模型中的高维 curse
计算与语言
2026-03-06 v1
摘要
大规模语言模型(LLM) operates in extremely high-dimensional state spaces,其中既包含 token 嵌入,也包含隐藏表示,构成了复杂的依赖关系,难以简化为经典的马尔可夫结构。本文探讨了一种理论上可行的 LLM 动力学近似方法,即 N 阶加法马尔可夫链。此类模型允许将下一个 token 的条件概率分解为来自多个历史深度的贡献的叠加,从而减少通常与高阶马尔可夫过程相关的组合爆炸。本文的主要结果是建立了加法多步链与具有时序记忆函数的链之间的对应关系。这一等价性使得我们能够引入信息温度(information temperature)的概念,不仅适用于时序链,也适用于加法 N 阶马尔可夫链。
引用
@article{arxiv.2603.04412,
title = {Additive Multi-Step Markov Chains and the Curse of Dimensionality in Large Language Models},
author = {O. V. Usatenko and S. S. Melnyk and G. M. Pritula},
journal= {arXiv preprint arXiv:2603.04412},
year = {2026}
}
备注
10 pages, 3 figures