中文

用于长上下文语言建模的门控可微工作记忆

计算与语言 2026-01-21 v1

摘要

长上下文对 Transformer 提出了挑战:注意力分数在数千个 token 中被稀释,关键信息通常在中间丢失,且模型在推理时难以适应新模式。最近关于测试时适应的工作通过维护一种工作记忆(即在当前上下文上更新的瞬态参数)来解决这一问题,但现有方法依赖统一的写入策略,在低效用区域浪费计算资源,并在语义异构的上下文中产生高梯度方差。在本工作中,我们将测试时适应重新构建为预算受限的记忆巩固问题,侧重于在有限计算量下应将上下文的哪些部分巩固到工作记忆中。我们提出了 Gdwm(门控可微工作记忆,Gated Differentiable Working Memory),一种引入写入控制器以门控巩固过程的框架。该控制器估计上下文效用(Contextual Utility,一种对长程上下文依赖的信息论度量),并据此分配梯度步数,同时保持全局覆盖。在 ZeroSCROLLS 和 LongBench v2 上的实验表明,Gdwm 以比统一基线少 4×\times 的梯度步数实现了相当或更优的性能,为测试时适应确立了新的效率-性能 Pareto 前沿。

关键词

引用

@article{arxiv.2601.12906,
  title  = {Gated Differentiable Working Memory for Long-Context Language Modeling},
  author = {Lingrui Mei and Shenghua Liu and Yiwei Wang and Yuyao Ge and Baolong Bi and Jiayu Yao and Jun Wan and Ziling Yin and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2601.12906},
  year   = {2026}
}