SCALAR:基于科学引用的长上下文学术推理实时评估
计算与语言
2026-01-23 v2
摘要
长上下文理解已成为大型语言模型(LLM)的一项关键能力。然而,评估这一能力仍具挑战性。我们提出 SCALAR,一个旨在评估学术写作中基于引用的长上下文推理的基准。SCALAR 利用学术论文及其引用结构,在无需人工标注的情况下自动生成高质量的基准真值标签。它具有可控的难度级别和缓解数据污染的动态更新机制。该基准包含两项任务:多项选择问答格式和填空式引用预测。我们评估了一系列最先进的 LLM,发现多项选择任务能有效区分模型能力。人类专家的准确率超过 90%,而大多数模型表现不佳。填空式任务更具挑战性,没有模型准确率超过 50%。SCALAR 提供了一个基于领域且持续更新的框架,用于跟踪基于引用的长上下文理解的进展。
引用
@article{arxiv.2502.13753,
title = {SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning},
author = {Renxi Wang and Honglin Mu and Liqun Ma and Lizhi Lin and Yunlong Feng and Timothy Baldwin and Xudong Han and Haonan Li},
journal= {arXiv preprint arXiv:2502.13753},
year = {2026}
}