中文

长情境监督实际去向?有效情境暴露平衡

计算与语言 2026-05-12 v1

摘要

长情境适应常被视为窗口扩展,但这忽略了 token 级别的监督不匹配:在填充训练中进行文档掩码时,每个目标 token 的有效情境仍然较短。我们引入 EXACT(Effective-Context Exposure Balancing),该方法通过反频率在长尾中为长有效情境目标分配额外权重。跨七个 Qwen/LLaMA CPT 配置,EXACT 在所有 28 个训练/外推 NoLiMa 和 RULER 比较中均取得改进。在 Qwen2.5-0.5B 上,NoLiMa 训练时提升 +10.09,外推时提升 +5.34;RULER 提升 +10.69 和 +5.55。在 LLaMA-3.2-3B 上,RULER 提升 +17.91 和 +16.11。标准 QA/推理保持稳定(+0.24 的宏观变化跨六个基准)。距离分辨探针显示,收益出现在证据数千 token 远处,而短案例保持不变。结果支持一种监督中心论:长情境适应取决于训练如何强烈监督长情境预测。

关键词

引用

@article{arxiv.2605.10544,
  title  = {Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing},
  author = {Jinchang Zhu and Jindong Li and Chengyu Zou and Rong Fu and Chao Wang and Haowei He and Menglin Yang},
  journal= {arXiv preprint arXiv:2605.10544},
  year   = {2026}
}