中文

大语言模型能否成为优秀的路径规划器?一项关于时空推理的基准测试与研究

计算与语言 2025-02-25 v3

摘要

大语言模型(LLMs)在广泛任务中取得了显著成功;然而,在需要长期规划与空间推理的场景下它们仍面临局限。为推动这一研究方向,本文提出了一个新基准,称为从自然语言进行路径规划(PPNL)。我们的基准通过将“路径规划”任务形式化来评估 LLM 的时空推理能力,该任务要求 LLM 在避开障碍物并遵守约束的同时导航至目标位置。利用该基准,我们系统地研究了包括 GPT-4(通过不同少样本提示方法)以及不同规模的 BART 和 T5(通过微调)在内的 LLM。实验结果表明,当以交错方式进行推理与行动提示时,少样本 GPT-4 在空间推理上展现出潜力,尽管它仍无法执行长期时间推理。相比之下,虽然微调后的 LLM 在分布内推理任务上取得了令人印象深刻的成果,但它们难以泛化到更大的环境或具有更多障碍物的环境。

关键词

引用

@article{arxiv.2310.03249,
  title  = {Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning},
  author = {Mohamed Aghzal and Erion Plaku and Ziyu Yao},
  journal= {arXiv preprint arXiv:2310.03249},
  year   = {2025}
}