SSP:通过联合优化行为和空间约束实现安全保障的外科政策
机器人学
2026-03-10 v1
摘要
机器人辅助手术的范式正在向数据驱动的自主性转变,这种自主性通过强化学习(RL)或模仿学习(IL)实现复杂任务的执行。然而,这些“黑箱”策略往往缺乏形式化的安全保证,这是临床部署的关键要求。本文提出了安全保障的外科政策(SSP)框架,以弥补数据驱动的通用性与形式安全之间的差距。我们利用神经常微分方程(Neural ODEs)从演示数据中学习出具不确定性感知的动力学模型。该学习模型支撑着稳健的控制障碍函数(CBF)安全控制器,该控制器最小修改外科政策的动作,以确保在不确定性下严格的安全。我们的控制器强制执行两种约束类别:行为约束(限制代理的任务空间)和空间约束(定义外科禁区)。我们以来自 RL、IL 和控制李ouville函数(CLF)的 SSP 框架实例化。在 SurRoL 模拟和 da Vinci Research Kit(dVRK)上的验证表明,我们的方法在实现近零约束违规率的同时,相对于无约束基线保持了高任务成功率。
引用
@article{arxiv.2603.07032,
title = {SSP: Safety-guaranteed Surgical Policy via Joint Optimization of Behavioral and Spatial Constraints},
author = {Jianshu Hu and ZhiYuan Guan and Lei Song and Kantaphat Leelakunwet and Hesheng Wang and Wei Xiao and Qi Dou and Yutong Ban},
journal= {arXiv preprint arXiv:2603.07032},
year = {2026}
}