中文

面向外科手术机器人的基于世界模型的视觉-运动抓取

机器人学 2025-08-18 v1 人工智能

摘要

抓取是机器人辅助手术(RAS)中的基本任务,自动化抓取可在遥操作系统之外提升外科医生的工作负担,同时增强效率、安全性和一致性。大多数先前方法依赖显式的对象姿态跟踪或手工设计的视觉特征,限制了其对新对象的泛化能力、对视觉扰动的鲁棒性,以及处理可变形对象的能力。视觉-运动学习提供了有前景的替代方案,但在RAS中部署其独特挑战包括视觉观察的信噪比低、对高安全性和毫米级精度的要求,以及复杂的手术环境。本文针对三个关键挑战:(i)将视觉-运动策略从仿真平移到体外手术场景,(ii)仅使用单个立体相机对的视觉-运动学习——这是RAS的标准设置,以及(iii)实现对象无关的抓取,采用单一策略对通用、未见过的手术对象进行抓取,无需重新训练或使用任务特定模型。我们引入手术抓取 anything V2(GASv2),一个用于手术抓取的视觉-运动学习框架。GASv2利用基于世界模型的架构和手术感知管道处理视觉观察,结合安全执行的混合控制系统。我们在仿真中训练该策略,采用域随机化进行仿真到现实的平移,并在真实机器人上部署于基于假体和体外手术场景中,使用单个内窥相机对。广泛的实验表明,我们的策略在两个场景中均 achieves 65% 的成功率,对未知对象和夹具具有良好泛化性,并能适应多样化的扰动,显示出强大的性能、通用性和鲁棒性。

关键词

引用

@article{arxiv.2508.11200,
  title  = {Visuomotor Grasping with World Models for Surgical Robots},
  author = {Hongbin Lin and Bin Li and Kwok Wai Samuel Au},
  journal= {arXiv preprint arXiv:2508.11200},
  year   = {2025}
}