中文

LPC-SM:局部预测编码与稀疏存储用于长上下文语言建模

计算与语言 2026-04-11 v1 人工智能 神经与进化计算

摘要

当前大多数长上下文语言模型仍依赖注意力机制处理局部互动和长程状态,这留下了有限的空间来测试序列建模的替代分解。我们提出了LPC-SM(Local Predictive Coding and Sparse Memory),一种混合自回归架构,将局部注意力、持久存储、预测校正和运行时控制在同一模块中分离处理,并使用正交新颖传输(Orthogonal Novelty Transport, ONT)来控制慢存储写入。我们在1.58亿参数模型上进行了三个阶段的评估:基础语言建模、数学延续和4096 token延续。移除mHC会使Stage-A最终LM损失从12.630升至15.127,而自适应稀疏控制会使Stage-B最终LM损失从12.137降至10.787。完整方案在4096序列长度下保持稳定,Stage C最终LM损失为11.582,延迲标识符诊断器的关键交叉熵从14.396降至12.031。综合来看,这些结果表明,长上下文自回归建模可以围绕比注意力alone 更广泛的职能划分进行组织。

关键词

引用

@article{arxiv.2604.03263,
  title  = {LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling},
  author = {Keqin Xie},
  journal= {arXiv preprint arXiv:2604.03263},
  year   = {2026}
}