中文

评估视觉输入对机器人路径规划中多模态大语言模型的价值:一个基准测试

机器人学 2025-07-17 v1

摘要

大语言模型(LLM)显示出增强机器人路径规划的潜力。本文通过一个全面的基准测试评估视觉输入在此类任务中对多模态LLM的实用性。我们在2D网格环境中对15个多模态LLM进行评估,模拟简化的机器人规划,比较仅文本输入与文本加视觉输入在不同模型规模和网格复杂度下的表现。我们的结果表明,在较简单的小网格上,视觉输入或少量文本提示能提供一定帮助,成功率适中。然而,在较大网格上,性能显著下降,凸显了可扩展性挑战。虽然较大的模型通常实现更高的平均成功率,但视觉模态并不普遍优于结构良好的文本输入,这些多模态系统的成功路径通常质量较高。这一结果表明当前在鲁棒空间推理、约束遵循和可扩展多模态集成方面存在局限,确定了未来LLM在机器人路径规划中开发的方向。

关键词

引用

@article{arxiv.2507.12391,
  title  = {Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic Path Planning},
  author = {Jacinto Colan and Ana Davila and Yasuhisa Hasegawa},
  journal= {arXiv preprint arXiv:2507.12391},
  year   = {2025}
}

备注

Accepted at the 2025 SICE Festival with Annual Conference (SICE FES)