L$^2$M:长上下文语言建模的互信息比例定律
计算与语言
2025-10-27 v2 人工智能
信息论
机器学习
math.IT
数据分析、统计与概率
摘要
我们提出了一种基于二分互信息比例定律的普适理论框架,用以理解长上下文语言建模。我们在自然语言中严格验证了该定律。我们展示了二分互信息捕捉到的多token相互作用与传统两点互信息不同,且独立于后者进行比例扩展,这为更完整地表征建模长序列所需的依赖关系提供了更全面的特征。基于这一比例定律,我们提出了长上下文语言建模(LM)条件,该条件下界了有效长上下文建模所需模型历史状态——负责存储过去信息的隐变量——的必要扩展规模。我们在Transformer模型和状态空间模型上验证了该框架及其预测。我们的工作为理解长上下文建模及设计更高效架构以提升长上下文能力提供了原则性基础,潜在应用范围远超自然语言。
关键词
引用
@article{arxiv.2503.04725,
title = {L$^2$M: Mutual Information Scaling Law for Long-Context Language Modeling},
author = {Zhuo Chen and Oriol Mayné i Comas and Zhuotao Jin and Di Luo and Marin Soljačić},
journal= {arXiv preprint arXiv:2503.04725},
year = {2025}
}
备注
34 pages, 13 figures, 2 tables