中文

基于信息论的理解 Transformer 在上下文学习可变阶马尔可夫链

机器学习 2026-04-01 v3 信息论 math.IT

摘要

我们研究了 Transformer 在上下文学习可变长度马尔可夫链 (VOMCs) 的情况,关注随着上下文示例数量增加的有限样本准确性。与固定阶马尔可夫链 (FOMCs) 相比,学习 VOMCs 要困难得多,这是由于额外的结构学习组件所致。该问题天然适合贝叶斯公式,在信息论社区为通用数据压缩而开发的上下文树加权 (CTW) 算法提供了最优解。实验上,我们发现单层 Transformer 无法在上下文中学习 VOMCs,而具有两层或更多层的 Transformer 能够成功,额外的层数带来了显著但肯定的改进。与 FOMCs 的既有结果不同,仅注意力的网络对 VOMCs 似乎不足。为解释这些发现,我们提供了明确的 Transformer 构建:一个具有 D+2D+2 层的构造能够精确实现 VOMCs 最大阶数为 DD 的 CTW,以及一个简化的两层构造使用部分信息进行近似混合,阐明了为何两层 Transformer 能够表现良好。

关键词

引用

@article{arxiv.2410.05493,
  title  = {An Information-Theoretic Approach to Understanding Transformers' In-Context Learning of Variable-Order Markov Chains},
  author = {Ruida Zhou and Chao Tian and Suhas Diggavi},
  journal= {arXiv preprint arXiv:2410.05493},
  year   = {2026}
}

备注

AISTATS 2026