中文

通过供用性引导与自洽的 MLLM 缓解跨模态干扰并确保几何可行性:面向指令遵循操作的任务规划

机器人学 2025-10-09 v2 人工智能

摘要

我们研究了使用具备上下文学习的多模态大语言模型(MLLMs)进行指令遵循操作中的闭环任务规划。我们确定了成功任务规划的四个基本要求:数量估计、可达性分析、相对定位和碰撞避免。然而,现有的基准测试无法支持对所有这些方面的整体评估。为了填补这一空白,我们引入了 \textbf{QuARC}(数量、分析、相对定位、碰撞),这是一个基于食物准备场景并整合了所有四个挑战的新基准测试。使用 QuARC,我们揭示了当前 MLLM 的两个主要局限性:跨模态干扰和几何不可行性。为了解决这些问题,我们采用带有自洽性的思维链来缓解跨模态干扰导致的推理损失,并引入供用性预测器以基于几何可行性来指导规划。我们的综合评估分析了多个基线的性能,并解释了性能提升的来源。我们的方法在该基准测试上达到了 76.7\% 的成功率,显著优于 ViLa 基线(36.7\%),且无需额外微调。代码和数据集可在 https://hcis-lab.github.io/Affordance-Guided-Self-Consistent-MLLM 获取。

关键词

引用

@article{arxiv.2503.13055,
  title  = {Mitigating Cross-Modal Distraction and Ensuring Geometric Feasibility via Affordance-Guided and Self-Consistent MLLMs for Task Planning in Instruction-Following Manipulation},
  author = {Yu-Hong Shen and Chuan-Yu Wu and Yi-Ru Yang and Yen-Ling Tai and Yi-Ting Chen},
  journal= {arXiv preprint arXiv:2503.13055},
  year   = {2025}
}