中文

SCALAR:基于科学引用的长上下文学术推理实时评估

计算与语言 2026-01-23 v2

摘要

长上下文理解已成为大型语言模型(LLM)的一项关键能力。然而,评估这一能力仍具挑战性。我们提出 SCALAR,一个旨在评估学术写作中基于引用的长上下文推理的基准。SCALAR 利用学术论文及其引用结构,在无需人工标注的情况下自动生成高质量的基准真值标签。它具有可控的难度级别和缓解数据污染的动态更新机制。该基准包含两项任务:多项选择问答格式和填空式引用预测。我们评估了一系列最先进的 LLM,发现多项选择任务能有效区分模型能力。人类专家的准确率超过 90%,而大多数模型表现不佳。填空式任务更具挑战性,没有模型准确率超过 50%。SCALAR 提供了一个基于领域且持续更新的框架,用于跟踪基于引用的长上下文理解的进展。

关键词

引用

@article{arxiv.2502.13753,
  title  = {SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning},
  author = {Renxi Wang and Honglin Mu and Liqun Ma and Lizhi Lin and Yunlong Feng and Timothy Baldwin and Xudong Han and Haonan Li},
  journal= {arXiv preprint arXiv:2502.13753},
  year   = {2026}
}