长情境监督实际去向?有效情境暴露平衡
计算与语言
2026-05-12 v1
摘要
长情境适应常被视为窗口扩展,但这忽略了 token 级别的监督不匹配:在填充训练中进行文档掩码时,每个目标 token 的有效情境仍然较短。我们引入 EXACT(Effective-Context Exposure Balancing),该方法通过反频率在长尾中为长有效情境目标分配额外权重。跨七个 Qwen/LLaMA CPT 配置,EXACT 在所有 28 个训练/外推 NoLiMa 和 RULER 比较中均取得改进。在 Qwen2.5-0.5B 上,NoLiMa 训练时提升 +10.09,外推时提升 +5.34;RULER 提升 +10.69 和 +5.55。在 LLaMA-3.2-3B 上,RULER 提升 +17.91 和 +16.11。标准 QA/推理保持稳定(+0.24 的宏观变化跨六个基准)。距离分辨探针显示,收益出现在证据数千 token 远处,而短案例保持不变。结果支持一种监督中心论:长情境适应取决于训练如何强烈监督长情境预测。
引用
@article{arxiv.2605.10544,
title = {Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing},
author = {Jinchang Zhu and Jindong Li and Chengyu Zou and Rong Fu and Chao Wang and Haowei He and Menglin Yang},
journal= {arXiv preprint arXiv:2605.10544},
year = {2026}
}