中文

用于外科手术抓取的无传感器高精度力 regulation 的混合离线-在线强化学习

机器人学 2026-03-02 v1

摘要

在tendon驱动的外科手术器械中,精确抓取力 regulation 受限于电机动力学、传动刚度、摩擦和远端力学之间的非线性耦合。现有解决方案通常依赖远端力传感或分析补偿,增加硬件复杂度或在动态运动下降低性能。我们提出了一个无传感器控制框架,结合物理一致建模和混合强化学习,以实现在靠近执行器控制的外科末端执行器中实现高精度的远端力 regulation。我们构建了一个基于第一性原理的数字孪生模型,捕捉电气、传动和颚部动力学于统一的微分代数格式。为在刚性和高度非线性系统中安全学习控制策略,我们引入三阶段管道:(i) 一个基于 receding-horizon CMA-ES 的 oracle 生成动态可行的专家轨迹,(ii) 通过隐式 Q 学习实现完全离线策略学习,确保无需不安全探索的稳定初始化,以及 (iii) 使用 TD3 进行在线细化以适应实际动态。 resulting 策略直接将靠近测量映射到电机电压,无需远端测量。在仿真中,该控制器在多谐波颚部运动期间保持抓取力在 desired reference 的 1% 内。硬件实验显示平均力误差低于 4%,跨越多样化轨迹,验证了仿真到实际的迁移。所学策略包含约 71k 参数,执行速度达 kH 级,支持实时部署。这些结果表明,高保真建模结合结构化离线-在线 RL 能够在无需额外测量的情况下恢复精确的远端力行为,为外科机器人操作提供可扩展且机械兼容的解决方案。

关键词

引用

@article{arxiv.2602.23870,
  title  = {Hybrid Offline-Online Reinforcement Learning for Sensorless, High-Precision Force Regulation in Surgical Robotic Grasping},
  author = {Edoardo Fazzari and Omar Mohamed and Khalfan Hableel and Hamdan Alhadhrami and Cesare Stefanini},
  journal= {arXiv preprint arXiv:2602.23870},
  year   = {2026}
}