中文

FocuSFT:面向稀释感知的长上下文微调双层优化

计算与语言 2026-05-12 v1

摘要

大语言模型现在能够处理越来越长的输入,但它们有效利用分散在长上下文中的信息的能力仍然有限。我们将这一差距追溯到在长序列上进行监督微调 (SFT) 时注意力预算的分配方式:位置偏差和注意力汇聚导致模型将大部分注意力分配给具有位置特权的 token,而不是语义相关的内容。这种训练时的注意力稀释(注意力分布中内容 token 的匮乏)削弱了梯度信号,限制了模型学习稳健长上下文能力的能力。我们引入了 FocuSFT,这是一个在训练时解决此问题的双层优化框架。内循环在训练上下文上调整轻量级快速权重参数,形成将注意力集中在相关内容上的参数化记忆,外循环在此锐化表示的基础上执行 SFT。两个循环都对上下文 token 应用双向注意力,同时保留对响应的因果掩蔽,从而减少了导致注意力汇聚的因果不对称性,并使内外循环行为保持一致。在 BABILong 上,FocuSFT 在 4K--32K 上下文长度上将准确率提高了多达 +14pp;在 RULER 上,它将 16K 处的 CWE 聚合从 72.9\% 提高到 81.1\%;在带有智能体工具使用的 GPQA 上,它在 pass@1 上获得了 24\% 的相对增益。注意力分析表明,FocuSFT 将注意力汇聚质量减少了 529×\times,并在训练期间使上下文参与度增加了两倍。代码:https://github.com/JarvisPei/FocuSFT

关键词

引用

@article{arxiv.2605.09932,
  title  = {FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning},
  author = {Zehua Pei and Hui-Ling Zhen and Xianzhi Yu and Sinno Jialin Pan and Mingxuan Yuan and Bei Yu},
  journal= {arXiv preprint arXiv:2605.09932},
  year   = {2026}
}