中文

3D-AffordanceLLM:利用大语言模型进行 3D 场景开放词汇性 affordance 检测

计算机视觉与模式识别 2025-03-05 v3 机器人学

摘要

3D affordance 检测是一项具有广泛应用前景的挑战性问题。现有方法通常将检测范式形式化为基于标签的语义分割任务,该范式依赖于预定义标签,且缺乏理解复杂自然语言的能力,导致在开放世界场景中的泛化能力受限。为此,我们将传统 affordance 检测范式重新定义为"指令推理 affordance 分割"(IRAS)任务。该任务旨在给定查询推理文本,输出 affordance 掩码区域,从而避免输入标签的固定类别。我们据此提出了"3D-AffordanceLLM"(3D-ADLLM),一个用于 3D 场景开放式 affordance 检测的框架。具体而言,3D-ADLLM 引入大语言模型(LLM)进行 3D affordance 感知,并设计自定义解码器用于生成 affordance 掩码,从而实现开放式推理 affordance 检测。此外,鉴于缺乏用于训练大规模模型的 3D affordance 数据集,我们寻求从通用分割数据中提取知识并迁移到 affordance 检测。因此,我们提出了多阶段训练策略,首先进行新颖的预训练任务,即"指代物体部分分割"(ROPS),该任务旨在使模型在物体-部件层面具备通用识别和分割能力。随后进行 IRAS 任务微调,3D-ADLLM 获得了 affordance 检测的推理能力。总之,3D-ADLLM 利用了 LLM 所蕴含的丰富世界知识和人类-对象交互推理能力,在开放词汇性 affordance 检测任务中实现了约 8% 的 mIoU 提升。

关键词

引用

@article{arxiv.2502.20041,
  title  = {3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds},
  author = {Hengshuo Chu and Xiang Deng and Qi Lv and Xiaoyang Chen and Yinchuan Li and Jianye Hao and Liqiang Nie},
  journal= {arXiv preprint arXiv:2502.20041},
  year   = {2025}
}

备注

ICLR