中文

EMA并非全部:映射递归上下文中结构与内容边界

计算与语言 2026-04-13 v1 人工智能

摘要

高效序列模型为何优于简单的时间加权?我们使用指数滑动平均(EMA)轨迹——最简单的递归上下文(无门控、无内容检索),作为受控探针,映射固定系数累加的表示边界。EMA轨迹编码时间结构:一个具备多时间尺度轨迹的赫伯特架构,在零标签下实现96%的监督BiGRU在语法角色分配上的性能,在结构相关角色上甚至超越监督模型。EMA轨迹消除token身份:一个仅使用EMA上下文的1.3亿参数语言模型即可达到C4困惑度260(8倍GPT-2),且替换线性预测器为全softmax注意力的消融实验结果相同,定位整个差距到轨迹上。这些轨迹采用有损、数据无关的压缩;根据数据处理不等式,任何下游预测器都无法恢复被丢弃的信息。固定系数累加,无论是跨时间还是跨深度,都会导致不可逆的信息稀释,只有学习的、输入依赖的选择才能解决。

关键词

引用

@article{arxiv.2604.08556,
  title  = {EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context},
  author = {Arth Singh},
  journal= {arXiv preprint arXiv:2604.08556},
  year   = {2026}
}

备注

10 pages, 1 figure, 7 tables