中文

SPGrasp:基于时空提示的动态场景抓取合成

机器人学 2025-09-03 v2 人工智能 计算机视觉与模式识别

摘要

实时交互式抓取合成在动态物体上仍具有挑战性,因为现有方法在保持可提示性的同时难以实现低延迟推理。为弥合这一差距,我们提出 SPGrasp (时空提示驱动的动态抓取合成),一种 novel 框架,将 segment anything model v2 (SAMv2) 扩展用于视频流抓取估计。我们的核心创新将用户提示与时空上下文相结合,使我们能够实现最低可达 59 毫秒的端到端延迟,同时确保动态物体的时序一致性。在基准评估中,SPGrasp 在 OCID 和 Jacquard 上实现了 90.6% 和 93.8% 的实例级抓取准确率。在具有连续跟踪的具有挑战性 GraspNet-1Billion 数据集上,SPGrasp 实现了 92.0% 的准确率,帧延迟为 73.1 毫秒,较先前的最新可提示方法 RoG-SAM 降低了 58.5%,同时保持竞争的准确率。我们在涉及 13 个移动物体的实际实验中,实现了 94.8% 的交互式抓取成功率。这些结果表明 SPGrasp 有效解决了动态抓取合成中的延迟与可提示性之间的权衡。

关键词

引用

@article{arxiv.2508.20547,
  title  = {SPGrasp: Spatiotemporal Prompt-driven Grasp Synthesis in Dynamic Scenes},
  author = {Yunpeng Mei and Hongjie Cao and Yinqiu Xia and Wei Xiao and Zhaohan Feng and Gang Wang and Jie Chen},
  journal= {arXiv preprint arXiv:2508.20547},
  year   = {2025}
}