EMA并非全部:映射递归上下文中结构与内容边界
计算与语言
2026-04-13 v1 人工智能
摘要
高效序列模型为何优于简单的时间加权?我们使用指数滑动平均(EMA)轨迹——最简单的递归上下文(无门控、无内容检索),作为受控探针,映射固定系数累加的表示边界。EMA轨迹编码时间结构:一个具备多时间尺度轨迹的赫伯特架构,在零标签下实现96%的监督BiGRU在语法角色分配上的性能,在结构相关角色上甚至超越监督模型。EMA轨迹消除token身份:一个仅使用EMA上下文的1.3亿参数语言模型即可达到C4困惑度260(8倍GPT-2),且替换线性预测器为全softmax注意力的消融实验结果相同,定位整个差距到轨迹上。这些轨迹采用有损、数据无关的压缩;根据数据处理不等式,任何下游预测器都无法恢复被丢弃的信息。固定系数累加,无论是跨时间还是跨深度,都会导致不可逆的信息稀释,只有学习的、输入依赖的选择才能解决。
引用
@article{arxiv.2604.08556,
title = {EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context},
author = {Arth Singh},
journal= {arXiv preprint arXiv:2604.08556},
year = {2026}
}
备注
10 pages, 1 figure, 7 tables