中文

面向长上下文语言模型的可控评测

计算与语言 2025-10-21 v2

摘要

现有的长上下文语言模型(LCLM)评测框架可大致分为真实世界应用(如文档摘要)和合成任务(如大海捞针)。尽管两者各有其用,但均伴随某些固有局限。真实世界任务通常涉及使其难以解释的复杂性,且存在数据污染问题;而合成任务则常常缺乏目标信息(针)与其周围上下文(草堆)之间有意义的连贯性,削弱了其作为真实应用代理的有效性。针对这些挑战,我们认为理想的上下文评测框架应具备三个基本特征:1)无缝上下文;2)可控设定;3)可靠评测。本研究引入了 LongBioBench\textbf{LongBioBench},这是一个利用人工生成的传记作为受控环境的基准,用于在理解、推理和可信度维度上评估 LCLM。我们的实验评测共包含 18 个 LCLM,结果表明大多数模型在检索结果的语义理解和基础推理方面仍存在缺陷,且随着上下文长度的增加可信度降低。我们的进一步分析表明,现有合成基准采用的一些设计选择,如上下文不连贯、数字针以及缺乏干扰项,使其在测试模型的长上下文能力时显得脆弱。总而言之,与以往的合成基准相比,LongBioBench 在反映真实语言任务与保持可控性之间取得了更好的平衡,且具有高度的可解释性和可配置性。

关键词

引用

@article{arxiv.2506.02921,
  title  = {A Controllable Examination for Long-Context Language Models},
  author = {Yijun Yang and Zeyu Huang and Wenhao Zhu and Zihan Qiu and Fei Yuan and Jeff Z. Pan and Ivan Titov},
  journal= {arXiv preprint arXiv:2506.02921},
  year   = {2025}
}

备注

NeurIPS 2025 Dataset and Benchmark Track Spotlight