中文

利用 LongCat ZigZag Attention 实现高效的上下文扩展

计算与语言 2026-01-07 v2 人工智能

摘要

我们引入了 LongCat ZigZag Attention (LoZA),这是一种稀疏注意力方案,旨在以相当有限的计算预算将任何现有的全注意力模型转换为稀疏版本。在长上下文场景中,LoZA 能够在预填充密集型(例如,检索增强生成)和解码密集型(例如,工具集成推理)情况下均实现显著加速。具体而言,通过在训练中期将 LoZA 应用于 LongCat-Flash,我们提供了 LongCat-Flash-Exp 作为长上下文基础模型,该模型能够快速处理多达 100 万个 token,从而实现高效的长程推理与长视界智能体能力。

关键词

引用

@article{arxiv.2512.23966,
  title  = {Efficient Context Scaling with LongCat ZigZag Attention},
  author = {Chen Zhang and Yang Bai and Jiahuan Li and Anchun Gui and Keheng Wang and Feifan Liu and Guanyu Wu and Yuwei Jiang and Defei Bu and Li Wei and Haihang Jing and Hongyin Tang and Xin Chen and Xiangzhou Huang and Fengcun Li and Rongxiang Weng and Yulei Qian and Yifan Lu and Yerui Sun and Jingang Wang and Yuchen Xie and Xunliang Cai},
  journal= {arXiv preprint arXiv:2512.23966},
  year   = {2026}
}

备注

10 pages, 3 figures, 3 tables