中文

PAVLM:基于视觉语言模型的点云基于 affordance 理解突破

机器人学 2025-07-08 v2 计算机视觉与模式识别

摘要

affordance 理解,即识别 3D 对象上可操作区域的任务,在允许机器人系统与物理世界交互和运行中发挥关键作用。虽然视觉语言模型 (VLM) 在机器人操作的高层推理和长期计划方面表现出色,但仍不足以把握有效的人机交互所需的细致物理属性。本文引入 PAVLM (Point cloud Affordance Vision-Language Model),一种创新框架,利用预训练语言模型中嵌入的大量多模态知识来增强点云的 3D affordance 理解。PAVLM 将几何引导的传播模块与大型语言模型 (LLM) 的隐藏嵌入集成,以丰富视觉语义。在语言方面,我们提示 Llama-3.1 模型生成细化的上下文感知文本,增强带有更深层语义线索的指令输入。在 3D-AffordanceNet 基准测试中进行的实验结果表明,PAVLM 在全点云和部分点云上均优于基线方法,尤其在对 3D 对象新颖开放式 affordance 任务的泛化方面表现突出。欲了解更多信息,请访问我们的项目站点:pavlm-source.github.io。

关键词

引用

@article{arxiv.2410.11564,
  title  = {PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model},
  author = {Shang-Ching Liu and Van Nhiem Tran and Wenkai Chen and Wei-Lun Cheng and Yen-Lin Huang and I-Bin Liao and Yung-Hui Li and Jianwei Zhang},
  journal= {arXiv preprint arXiv:2410.11564},
  year   = {2025}
}