中文

长上下文 LLM 中的智能退化:基于自然长度分布分析的临界阈值测定

计算与语言 2026-01-23 v1

摘要

大型语言模型 (LLMs) 在处理接近某些临界阈值的上下文时表现出灾难性的性能退化,即使信息仍然相关。这种智能退化——定义为任务性能下降超过 30%——严重限制了长上下文应用。这种退化表现出一种常见模式:模型在达到临界阈值前保持强劲性能,随后发生灾难性崩溃。我们将此称为浅层长上下文适应——模型适应了短至中等长度的上下文,但在超过临界阈值时失效。本文提出了三项贡献:(1) 自然长度分布分析:我们使用每个样本的自然 token 长度,不进行截断或填充,为退化源于上下文长度本身提供了更强的因果证据。(2) 临界阈值测定:通过在混合数据集(1000 个样本,覆盖上下文长度的 5%-95%)上的实验,我们通过五种方法的交叉验证,确定了 Qwen2.5-7B 的临界阈值在最大上下文长度的 40%-50% 处,此时 F1 分数从 0.55-0.56 下降至 0.3(退化 45.5%)。(3) 统一框架:我们整合了浅层适应,解释了退化模式并为缓解策略奠定了基础。这项工作提供了开源 Qwen 模型中智能退化的首次系统性表征,为在长上下文场景中部署 LLMs 提供了实用指导。

关键词

引用

@article{arxiv.2601.15300,
  title  = {Intelligence Degradation in Long-Context LLMs: Critical Threshold Determination via Natural Length Distribution Analysis},
  author = {Weiwei Wang and Jiyong Min and Weijie Zou},
  journal= {arXiv preprint arXiv:2601.15300},
  year   = {2026}
}

备注

29 pages