中文

Can-Do!:基于大型多模态模型具身规划的数据集与神经符号基础框架

人工智能 2024-09-24 v1 计算与语言 计算机视觉与模式识别 机器人学

摘要

大型多模态模型在视觉和语言任务中展现了令人瞩目的问题解决能力,并具有编码丰富世界知识的潜力。然而,对于这些模型而言,在真实环境中进行感知、推理、规划和行动仍然是一个开放性挑战。在这项工作中,我们引入了 Can-Do,这是一个旨在通过比以往数据集更加多样和复杂的场景来评估具身规划能力的基准数据集。我们的数据集包含 400 个多模态样本,每个样本由自然语言用户指令、描绘环境的视觉图像、状态变化以及相应的动作计划组成。这些数据涵盖了常识知识、物理理解和安全意识等多个方面。我们的细粒度分析表明,包括 GPT-4V 在内的 SOTA 模型在视觉感知、理解和推理能力方面面临瓶颈。为了应对这些挑战,我们提出了 NeuroGround,这是一个神经符号框架,它首先将计划生成基于感知到的环境状态,然后利用符号规划引擎来增强模型生成的计划。实验结果证明了我们的框架相较于强基线的有效性。我们的代码和数据集可在 https://embodied-planning.github.io 获取。

关键词

引用

@article{arxiv.2409.14277,
  title  = {Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models},
  author = {Yew Ken Chia and Qi Sun and Lidong Bing and Soujanya Poria},
  journal= {arXiv preprint arXiv:2409.14277},
  year   = {2024}
}