中文

从决策到行动的外科自主性:用于机器人辅助吸血的多模态大语言模型

机器人学 2025-01-30 v2

摘要

大语言模型(LLM)的兴起影响了机器人与自动化领域的研究。虽然将 LLM 集成到通用机器人任务中已取得进展,但在手术等更具体的领域中,其应用仍存在明显空白——在这些领域中,推理能力、可解释性和安全性等关键因素至关重要。实现机器人手术的自主性,即推理和适应环境变化的能力,仍然是一个重大挑战。在本工作中,我们提出将多模态 LLM 集成到机器人辅助手术中,用于自主吸血。推理与优先级决策被委托给高层任务规划 LLM,而运动规划与执行则由底层深度强化学习模型处理,从而在两个组件之间创建分布式代理。由于手术操作具有高度动态性并可能遇到意外情况,血凝块和活动性出血被引入以影响决策。结果表明,使用多模态 LLM 作为高层推理单元可以应对这些手术复杂性,从而实现机器人辅助手术中此前无法达到的推理水平。这些发现展示了多模态 LLM 在显著增强机器人辅助手术中的语境理解与决策能力的潜力,标志着迈向自主手术系统的一步。

关键词

引用

@article{arxiv.2408.07806,
  title  = {From Decision to Action in Surgical Autonomy: Multi-Modal Large Language Models for Robot-Assisted Blood Suction},
  author = {Sadra Zargarzadeh and Maryam Mirzaei and Yafei Ou and Mahdi Tavakoli},
  journal= {arXiv preprint arXiv:2408.07806},
  year   = {2025}
}

备注

Accepted for Publication in IEEE Robotics and Automation Letters, 2025