中文

每个 token 都计数:大语言模型中 16M 超长上下文的泛化

计算与语言 2025-12-01 v1 人工智能

摘要

本工作探讨构建“能够记忆的机器”的挑战,将长期记忆视为高效超长上下文建模的问题。我们认为这需要三个关键属性:稀疏性、随机访问灵活性和长度泛化。为解决超长上下文建模问题,我们利用层次稀疏注意力 (HSA),这是一种满足所有三个属性的新型注意力机制。我们将 HSA 集成到 Transformer 中构建 HSA-UltraLong,这是一个在超过 8 万亿标记上训练的 8B 参数 MoE 模型,并在不同任务上进行严格评估,分别进行域内和域外上下文长度,以展示其处理超长上下文的能力。结果表明,我们的模型在域内长度上与全注意力基线相当,在大多数 in-context 检索任务中实现超过 90% 的准确率,上下文长度可达 16M。本报告概述了我们的实验见解和开放问题,为未来超长上下文建模研究奠定了基础。

关键词

引用

@article{arxiv.2511.23319,
  title  = {Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models},
  author = {Xiang Hu and Zhanchao Zhou and Ruiqi Liang and Zehuan Li and Wei Wu and Jianguo Li},
  journal= {arXiv preprint arXiv:2511.23319},
  year   = {2025}
}