中文

基于大型多模态模型的面向指令的本体感 affordance 预测

机器人学 2025-08-26 v1 计算机视觉与模式识别

摘要

在物体操控语境中,本体感 affordance 对智能机器人至关重要。本文我们认为,affordance 应是任务/指令相关的,这一点被许多前期工作所忽视。即,不同的指令即使针对同一物体,也可能导致不同的操控区域和方向。根据这一观察,我们构建了一个新的数据集,包含一万五千个对象-指令-本体感三元组。数据集中的所有场景均来自本体感视角,旨�近似人类类机器人的视野。进一步,我们研究如何使大型多模态模型 (LMM) 作为本体感预测器。通过实现一个“反向验证搜索”管道,LMM 被要求逐步预测本体感,在迭代过程中,每个步骤的输出都由自身进行验证,以模拟推理过程。实验表明,我们的方法不仅 unlocks 新的指令导向本体感预测能力,而且在广泛范围内实现了卓越的性能。

关键词

引用

@article{arxiv.2508.17922,
  title  = {Egocentric Instruction-oriented Affordance Prediction via Large Multimodal Model},
  author = {Bokai Ji and Jie Gu and Xiaokang Ma and Chu Tang and Jingmin Chen and Guangxia Li},
  journal= {arXiv preprint arXiv:2508.17922},
  year   = {2025}
}