基于雅可比矩阵的双相强化学习用于可变形连续体机器人动态内腔导航
机器人学
2025-09-03 v1 人工智能
系统与控制
系统与控制
摘要
可变形连续体机器人(DCR)因非线性变形力学和部分状态可观测性,构成独特的规划挑战,违反了常规强化学习(RL)方法的马尔可夫假设。虽然雅可比矩阵方法为刚性操作器提供了理论基础,但其直接应用于DCR仍受时变运动学和不完全变形动力学限制。本文提出了基于雅可比矩阵的双相强化学习框架(JEDP-RL),将规划分解为雅可比矩阵估计与策略执行两个阶段。每一步训练中,我们首先进行小尺度局部探索动作以估计变形雅可比矩阵,然后将雅可比特征增强到状态表示中,以恢复近似马尔可夫性。广泛的SOFA外科动态仿真结果表明,JEDP-RL相对于近端策略优化(PPO)基线在三个方面具有显著优势:1)收敛速度:策略收敛快3.2倍,2)导航效率:达到目标所需步骤减少25%,3)泛化能力:在材料属性变化情况下实现92%的成功率,在未见过的组织环境中实现83%(比PPO高出33%)的成功率。
引用
@article{arxiv.2509.00329,
title = {Jacobian Exploratory Dual-Phase Reinforcement Learning for Dynamic Endoluminal Navigation of Deformable Continuum Robots},
author = {Yu Tian and Chi Kit Ng and Hongliang Ren},
journal= {arXiv preprint arXiv:2509.00329},
year = {2025}
}