SAM2Grasp: 基于Prompt条件的时序动作预测解决多模态抓取
机器人学
2025-12-03 v1 计算机视觉与模式识别
摘要
机器人抓取的仿照学习常因多模态问题而受阻: 当场景中存在多个有效目标时,对不同对象的抓取示范会创建相互冲突的训练信号.标准仿照学习策略通过对这些不同动作进行平均处理,生成单一无效动作.本文引入SAM2Grasp,一种新型框架通过重新构建为单模态、以Prompt为条件的预测问题来解决此问题.该方法利用冻结的SAM2模型的强大视觉时序跟踪能力,引入轻量级可训练的动作头与其本机分割头并行运行.此设计允许仅在SAM2预计算的时序视觉特征上训练小型动作头.推理时,初始Prompt(如由上游目标检测模型提供的边界框)指定要抓取的特定对象.该Prompt条件化动作头为该对象唯一明确的抓取轨迹预测.在随后所有视频帧中,SAM2内置的时序跟踪能力自动维护所选对象的稳定跟踪,使模型能够在无需进一步外部指导的情况下从视频流中持续预测抓取轨迹.这种时序- Prompt方法有效消除了视觉运动策略中的歧义.我们通过大量实验演示,SAM2Grasp在杂乱多目标抓取任务中实现了最先进的性能.
引用
@article{arxiv.2512.02609,
title = {SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction},
author = {Shengkai Wu and Jinrong Yang and Wenqiu Luo and Linfeng Gao and Chaohui Shang and Meiyu Zhi and Mingshan Sun and Fangping Yang and Liangliang Ren and Yong Zhao},
journal= {arXiv preprint arXiv:2512.02609},
year = {2025}
}