中文

基于视觉语言-动作模型的机器人护士系统RoboNurse-VLA

机器人学 2024-10-01 v1

摘要

在现代医疗领域,对自主式机器人助理的需求有显著增长,尤其是在手术室中,因其对手术任务的精确性和可靠性要求极高。机器人护士作为提高手术效率并减少人为错误的有前景的解决方案。然而,如何在动态环境中准确把握和递交手术器械,尤其是处理复杂或难以把握的器械,仍面临挑战。本文提出一种新型机器人护士系统RoboNurse-VLA,基于视觉语言-动作(VLA)模型,通过集成Segment Anything Model 2(SAM 2)和Llama 2语言模型实现。所提RoboNurse-VLA系统能够基于外科医生的语音指令实现对手术器械的实时高精度抓取和递交。利用领先的视觉和语言模型,系统可解决对象检测、姿态优化以及处理复杂和难以抓取器械的关键挑战。通过广泛评估,RoboNurse-VLA在手术器械递交任务中表现优于现有模型,即使在未见过的工具和具有挑战性的物品上也能实现高成功率。这一工作为自主手术辅助推进了重要一步,展示了将VLA模型集成到实际医疗应用中的潜力。更多细节可访问https://robonurse-vla.github.io。

关键词

引用

@article{arxiv.2409.19590,
  title  = {RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model},
  author = {Shunlei Li and Jin Wang and Rui Dai and Wanyu Ma and Wing Yin Ng and Yingbai Hu and Zheng Li},
  journal= {arXiv preprint arXiv:2409.19590},
  year   = {2024}
}