中文

AffordBot:基于多模态大语言模型的3D细粒度嵌入式推理

计算机视觉与模式识别 2025-11-14 v1

摘要

有效的人类-智能体协作在物理环境中需要理解不仅要作用的对象,还要可行动元素的具体位置以及如何与之交互。现有方法常仅 operate at object level,或零散处理细粒度可行动性推理,缺乏连贯且以指令为导向的 grounding 与推理。本文提出一种新任务:3D细粒度嵌入式推理,要求智能体基于任务指令,为每个被引用的可行动元素在3D场景中预测其包含空间位置、运动类型和运动轴的结构化三元组。在解决该任务方面,我们提出AffordBot,一种将多模态大语言模型(MLLM)与定制的链式思维(CoT)推理范式相集成的新框架。为弥合3D输入与2D兼容MLLM之间的差距,我们对场景进行环视图像渲染,并将3D元素候选者投影到这些视图中,形成与场景几何一致的丰富视觉表征。我们的CoT管道以主动感知阶段开始,引导MLLM根据指令选择最具信息性的视角,然后进行分步推理,以定位可行动元素并推断合理的交互运动。在SceneFun3D数据集上进行评估,AffordBot实现了最先进的性能,展现了强大的泛化能力和基于MLLM的物理驱动推理,仅凭3D点云输入即可实现。

关键词

引用

@article{arxiv.2511.10017,
  title  = {AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models},
  author = {Xinyi Wang and Xun Yang and Yanlong Xu and Yuchen Wu and Zhen Li and Na Zhao},
  journal= {arXiv preprint arXiv:2511.10017},
  year   = {2025}
}

备注

NeurIPS 2025