LLM 能否做火箭科学?探索GTOC 12中复杂推理的极限
人工智能
2026-02-04 v1
摘要
大型语言模型(LLM)在代码生成和通用推理方面已显示出惊人的能力,但其在高维物理约束环境中实现自主多阶段规划的能力仍是未开放的研究问题。本研究通过评估当前AI代理面对第12届全球轨道优化竞赛(GTOC 12)的能力来探讨其极限,该竞赛要求设计大型小行星采矿计划。我们将 MLE-Bench 框架适用于轨道力学领域,并部署基于 AIDE 的代理体系结构,以自主生成和细化任务解决方案。为评估性能,我们采用“LLM 作为裁判”方法,利用由领域专家开发的评分标准,对战略可行性进行评估。从 GPT-4-Turbo 到推理增强型架构如 Gemini 2.5 Pro 和 o3 的模型比较揭示了显著趋势:过去两年间,平均战略可行性得分几乎翻倍(从 9.3 增至 17.2,满分 26)。然而,我们识别出策略与执行之间的关键能力差距。尽管先进模型展示出 sophisticated 的概念理解能力,正确构建目标函数和任务体系结构,但在实现层面始终失败,因物理单位不一致、边界条件错误以及低效的调试循环。我们得出结论,尽管当前LLM常常具备解决空间科学任务的知识和智能,但其受限于实施障碍,充当强大的领域促进者而非完全自主工程师。
引用
@article{arxiv.2602.03630,
title = {Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12},
author = {Iñaki del Campo and Pablo Cuervo and Victor Rodriguez-Fernandez and Roberto Armellin and Jack Yarndley},
journal= {arXiv preprint arXiv:2602.03630},
year = {2026}
}
备注
Extended version of the paper presented at AIAA SciTech 2026 Forum. Includes futher experiments, corrections and new appendix