中文

通用外科抓取的世界模型

机器人学 2024-05-29 v1 人工智能

摘要

醫療機器人人工智慧視覺控制系統應該能夠適應未知且多樣的對象,同時對系統干擾具有穩健性。先前的方法未能滿足這些要求,因為主要依賴於姿態估計和特徵跟蹤。我們提出了基於世界模型的深層強化學習框架“Grasp Anything for Surgery”(GAS),用於醫療抓取,提高了普適性和穩健性。具體而言,提出了一種新方法,用於基於對 rigid-link 對象不準確區域的經驗先驛估計深度像素的值和不確定性;將深度圖和掩碼圖的任務對象編碼為單個緊湊的3通道圖像(大小:64x64x3),通過動態縮放掩碼區域以最小化資訊損失。對所學習的控制器的有效性進行了廣泛的模擬和實機評估。我們的學習視覺馬達策略處理:i) 未見對象,包括5種目標抓取對象和機器人抓手,在非結構化的現實世界外科環境中,以及ii) 感知和控制中的干擾。值得注意的是,我們是首個在複雜的手術場景中使用不同機器人抓手在實機上抓取多樣外科對象的統一外科控制系統(平均成功率:69%)。本系統還在包括背景變化、目標干擾、相機姿態變化、運動學控制誤差、圖像噪聲以及抓取目標對象掉落後重新抓取等6種條件下表現出顯著的穩健性。视频和代码可在我們的項目頁面上找到:https://linhongbin.github.io/gas/。

关键词

引用

@article{arxiv.2405.17940,
  title  = {World Models for General Surgical Grasping},
  author = {Hongbin Lin and Bin Li and Chun Wai Wong and Juan Rojas and Xiangyu Chu and Kwok Wai Samuel Au},
  journal= {arXiv preprint arXiv:2405.17940},
  year   = {2024}
}