AstroReason-Bench:评估跨异构空间规划问题的统一智能体规划
人工智能
2026-01-19 v1 计算与语言
摘要
智能体大型语言模型(LLM)的最新进展使其成为能够在多种任务中进行推理和行动的通用规划器。然而,现有的智能体基准主要关注符号化或弱接地环境,导致其在受物理约束的真实世界领域中的性能尚未得到充分探索。我们引入了 AstroReason-Bench,这是一个用于评估空间规划问题(SPP)中智能体规划的综合基准,该类问题具有异构目标、严格的物理约束和长时程决策等特征。AstroReason-Bench 集成了多种调度场景,包括地面站通信和敏捷地球观测,并提供了统一的面向智能体的交互协议。在一系列最先进的开源和闭源智能体 LLM 系统上进行评估,我们发现当前的智能体表现显著逊于专用求解器,突显了在现实约束下通用规划的关键局限性。AstroReason-Bench 为未来的智能体研究提供了一个具有挑战性且具诊断价值的测试平台。
引用
@article{arxiv.2601.11354,
title = {AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems},
author = {Weiyi Wang and Xinchi Chen and Jingjing Gong and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2601.11354},
year = {2026}
}