中文

基于2.5-D分解的LLM驱动空间构建

人工智能 2026-05-20 v2

摘要

从自然语言指令构建结构的自主系统需要可靠的空间推理,但大型语言模型(LLM)在生成三维块放置位置时会出现系统性坐标错误。我们提出了基于\emph{2.5-D分解}的神经符号管道:LLM在二维水平平面上进行规划,而确定性执行器计算所有垂直放置位置,基于列占用情况,从而消除了整个类别的错误。在Build What I Mean基准测试(160轮)上,GPT-4o-mini与该管道搭配实现了在12次独立运行中94.6%的平均结构准确率,仅落后于由建筑师代理人错误导致的97.6%上限(此类错误无法通过建造端改进所解决)。这超过了GPT-4o的90.3%以及最佳竞争系统的76.3%。受控消除实验确认,2.5-D分解是主要贡献者,占准确率提升的50.7个百分点。该管道可直接迁移到边缘硬件:在NVIDIA Jetson Thor AGX上本地运行的Nemotron-3 120B与云端结果相匹配,准确率为94.5%,且无需修改提示。该原理——从LLM输出空间中移除确定性维度——适用于任何自主建造或装配任务,其中重力或其他物理约束固定一个或多个自由度。对500个IGLU协作建造任务的迁移实验确认了这种效果在主要基准之外也具有普适性。

关键词

引用

@article{arxiv.2605.07066,
  title  = {2.5-D Decomposition for LLM-Based Spatial Construction},
  author = {Paul Whitten and Li-Jen Chen and Sharath Baddam},
  journal= {arXiv preprint arXiv:2605.07066},
  year   = {2026}
}