中文

ATLAS:跨尺度全方位长上下文能力测试框架

计算与语言 2026-05-28 v1

摘要

长上下文语言模型宣称上下文窗口可达数百万 token,但评估通常仅报告单一长度或局限于特定任务 family,掩盖了两种失效模式:随长度增长性能崩溃,以及强检索能力未必能转化为下游任务。我们提出ATLAS,一个重新将长上下文评估定义为长度依赖能力描绘的框架。ATLAS贡献三项方法论原则:(i) 分层分类学将基础操作与应用工作负载分离,便于归因失败;(ii) 长度感知AUC评分将得分-长度曲线在固定8K-1M网格上积分,用以取代单点指标,形成完整的性能衰减轮廓;(iii) ATLAScore 采用加权平均对分类学类别进行综合,惩罚不平衡轮廓,并从子集得分传递至非线性最终综合指标。我们在八个能力维度上实现该框架,包含九个可审计组件和6,438个实例,对26个模型进行评估。Gemini-3.1-Pro-Preview 在128K场景领先,Claude-Opus-4.6 在1M场景领先。排名在ATLAScore@8K-128K与ATLASscore@8K-1M之间发生显著变化:7个模型排名变动至少两位,两个分类学层之间的跨模型方差仅为61%,单个排名差异可达12个位置。这些结果支持按能力和长度报告长上下文质量,而非单一头条分。

关键词

引用

@article{arxiv.2605.28079,
  title  = {ATLAS: All-round Testing of Long-context Abilities across Scales},
  author = {Deli Huang and Cunguang Wang and Hongyin Tang and Zhe Tang and Linsen Guo and Dongyu Ru and Ruoshi Yuan and Ziyue Zhu and Xiaoyu Li and Ziwen Wang and Chen Zhang and Anchun Gui and Wen Zan and Jiaqi Zhang and Xuezhi Cao and Jingang Wang and Xunliang Cai and Yixin Cao},
  journal= {arXiv preprint arXiv:2605.28079},
  year   = {2026}
}

备注

29 pages, 13 figures. Preprint