中文

经认证的强化学习实现安全与最优可变阻抗控制

机器人学 2026-03-03 v2

摘要

强化学习 (RL) 提供了一种强大的机器人学习复杂协作技能的方法,结合 Dynamic Movement Primitives (DMPs) 进行运动控制和 Variable Impedance Control (VIC) 进行刚性互动。然而,这种基于模型的无监督方法由于阻抗增益的时间变性,常常面临不稳定和不安全探索的风险。本工作引入 Certified Gaussian Manifold Sampling (C-GMS),一种新颖的基于轨迹的 RL 框架,用于学习结合 DMP 和 VIC 的策略,同时通过构造保证 Lyapunov 稳定性和执行机构可行性。我们的方法将策略探索重新定义为从稳定增益时间表的数学定义流形上进行抽样。这确保了每一次策略 rollout 都保证是稳定且可物理实现的,从而消除了对奖励惩罚或事后验证的需要。此外,我们提供了理论保证,表明即使在存在有限模型误差和部署时不确定性的情况下,我们的方法也能确保跟踪误差有界。我们在仿真中展示了 C-GMS 的有效性,并在实际机器人上验证了其效用,为在复杂环境中实现可靠的自主互动铺平了道路。

关键词

引用

@article{arxiv.2511.16330,
  title  = {Safe and Optimal Variable Impedance Control via Certified Reinforcement Learning},
  author = {Shreyas Kumar and Ravi Prakash},
  journal= {arXiv preprint arXiv:2511.16330},
  year   = {2026}
}

备注

Accepted at ICRA 2026