中文

SepSeq:用于 LLMs 中处理长数值序列的无训练框架

计算与语言 2026-04-10 v1

摘要

尽管基于 Transformer 的大语言模型(LLMs)在理论上能够支持大规模上下文窗口,但在处理长数值序列时会出现严重的性能下降。我们将此失败归因于 Softmax 机制中的注意力扩散,导致模型无法集中注意力。为克服这一问题,我们提出了分离序列(Separate Sequence, SepSeq),这是一种无训练、即插即用的框架,通过 strategically 插入分隔符标记来缓解注意力扩散。机制上而言,我们证明,分隔符标记充当注意力汇 sink,重新校准注意力以聚焦于局部片段,同时保持全局上下文。对 9 个广泛采用的 LLMs 进行的广泛评估确认了该方法的有效性:SepSeq 在各个领域平均提升 35.6% 的相对准确率,同时将总推理 token 消耗降低 16.4%。

关键词

引用

@article{arxiv.2604.07737,
  title  = {SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs},
  author = {Jie Sun and Yu Liu and Lu Han and Qiwen Deng and Xiang Shu and Yang Xiao and Xingyu Lu and Jun Zhou and Pengfei Liu and Lintao Ma and Jiancan Wu and Xiang Wang},
  journal= {arXiv preprint arXiv:2604.07737},
  year   = {2026}
}

备注

16 pages, 4 figures, 5 tables