Mil-SCORE:面向大语言模型的长上下文地理空间推理与规划基准测试
计算与语言
2026-02-06 v3
摘要
随着大语言模型(LLM)被应用于越来越长且复杂的任务,迫切需要构建真实可靠的长上下文基准测试,以评估其对异构多模态信息源进行选择性读取与整合的能力。这一需求在地理空间规划问题中尤为紧迫,例如大规模军事行动的规划,要求对地图、命令、情报报告及其他分布式数据进行快速且准确的推理。为填补这一空白,我们提出了MilSCORE(Military Scenario Contextual Reasoning),据称是首个基于复杂模拟军事规划情景,由专家编写的多跳问题数据集,用于训练。MilSCORE旨在评估高风险决策与规划,检验大语言模型综合战术与空间推理跨多个信息源的能力,以及其在长期、地理空间丰富背景下的推理能力。该基准涵盖七类问题类型,涉及事实性记忆与关于约束、策略和空间分析的多步骤推理。我们提供了评估协议并报告了当代多模态视觉语言模型的基线结果。我们的发现表明,MilSCORE上仍有显著提升空间,说明当前系统在真实情景级别的长上下文规划方面存在挑战,使MilSCORE成为未来工作的具有挑战性的测试平台。
引用
@article{arxiv.2601.21826,
title = {Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models},
author = {Aadi Palnitkar and Mingyang Mao and Nicholas Waytowich and Vinicius G. Goecks and Xiaomin Lin},
journal= {arXiv preprint arXiv:2601.21826},
year = {2026}
}