中文

基于梯度的正则化用于机器人控制中的动作平滑性

机器人学 2024-07-08 v1

摘要

深度强化学习 (DRL) 在从复杂计算机游戏到真实世界应用方面取得了显著的成功,展示了在动态环境中学习的智能代理的潜力。然而,其在真实场景中的应用面临着挑战,包括“抖动”问题,即抖动的轨迹不仅会损害系统安全,还会增加功耗并缩短机器人和自主系统的服务寿命。为解决抖动动作问题,提出了一种称为条件动作策略平滑性 (conditioning for action policy smoothness, CAPS) 的方法,通过添加正则化项来减少动作变化。本文进一步提出了一种新方法,称为基于梯度的CAPS (Gradient-based CAPS, Grad-CAPS),通过减少动作梯度的差异,然后使用位移归一化,使代理能够适应不变的动作尺度。因此,我们的方法有效地减少了杂乱动作序列,同时增强了策略的表达力和方法在不同场景和环境中的适应性。在实验中,我们将Grad-CAPS集成到不同的强化学习算法中,并在DeepMind控制套件和OpenAI Gym环境中的各种机器人相关任务上对其性能进行评估。结果表明,Grad-CAPS在保持与CAPS和Vanilla代理相当的平滑性水平的同时,有效改进了性能。

关键词

引用

@article{arxiv.2407.04315,
  title  = {Gradient-based Regularization for Action Smoothness in Robotic Control with Reinforcement Learning},
  author = {I Lee and Hoang-Giang Cao and Cong-Tinh Dao and Yu-Cheng Chen and I-Chen Wu},
  journal= {arXiv preprint arXiv:2407.04315},
  year   = {2024}
}

备注

Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024