Point2Act:面向零-shot 上下文感知抓取的多模态 LLM 3D 蒸馏
机器人学
2026-03-05 v2
摘要
我们提出了 Point2Act,直接检索上下文描述任务相关的 3D 动作点,利用多模态大型语言模型(MLLM)。基石模型为通用机器人提供了零-shot 跟随自然语言描述在未见环境中执行任务的可能性。虽然来自大规模图像和语言数据集的语义在 2D 图像中提供了上下文理解,但丰富且细致的特征推导模糊的 2D 区域,难以找到针对动作的精确 3D 位置。我们提出的 3D 可相关性场绕过高维特征,反而高效地为特定于任务的动作注入轻量级 2D 点级指导。多视角聚合有效补偿了由于几何模糊性(如遮挡)或语言描述固有的语义不确定性导致的对齐误差。输出区域高度局部化,推理细致的 3D 空间上下文可直接传递到场景即时重建的物理动作位置。我们的全栈管道包括捕获、MLLM 查询、3D 重建和抓取姿态提取,能够在 20 秒内内生成空间上arag 响应,促进实际操纵任务。项目页面:https://sangminkim-99.github.io/point2act/。
引用
@article{arxiv.2508.03099,
title = {Point2Act: Efficient 3D Distillation of Multimodal LLMs for Zero-Shot Context-Aware Grasping},
author = {Sang Min Kim and Hyeongjun Heo and Junho Kim and Yonghyeon Lee and Young Min Kim},
journal= {arXiv preprint arXiv:2508.03099},
year = {2026}
}
备注
Accepted to ICRA 2026