中文

Meta SAC-Lag:面向可部署安全强化学习的基于元梯度的超参数调优方法

机器学习 2024-08-16 v1 人工智能 机器人学 系统与控制 系统与控制

摘要

安全强化学习(Safe RL)是旨在部署于真实系统的试错方法中最广泛研究的子类别之一。在安全RL中,目标是在最小化约束的同时最大化奖励性能,通常通过设置约束函数的边界并利用拉格朗日方法来实现。然而,将基于拉格朗日方法的安全RL部署于真实场景具有挑战性,因为需要精细调整阈值,不精确的调整可能导致次优策略收敛。为缓解这一挑战,我们提出了一种统一的基于拉格朗日方法的无模型架构——Meta Soft Actor-Critic Lagrangian(Meta SAC-Lag)。Meta SAC-Lag利用元梯度优化自动更新安全相关的超参数。该方法旨在以最少的超参数调优需求解决安全探索和阈值调整问题。在我们的流水线中,内部参数通过常规公式更新,超参数则基于更新后的参数通过元目标进行调整。我们的结果表明,智能体能够可靠地调整安全性能,这归功于安全阈值的相对快速收敛。我们在五个模拟环境中评估了Meta SAC-Lag的性能,并与拉格朗日基线方法进行了对比,结果展示了其在参数之间创造协同效应的能力,从而产生了更好或具有竞争力的结果。此外,我们进行了一项真实世界实验,涉及一个将咖啡倒入杯中且不洒出的机械臂任务。Meta SAC-Lag成功训练以执行该任务,同时最小化努力约束。

关键词

引用

@article{arxiv.2408.07962,
  title  = {Meta SAC-Lag: Towards Deployable Safe Reinforcement Learning via MetaGradient-based Hyperparameter Tuning},
  author = {Homayoun Honari and Amir Mehdi Soufi Enayati and Mehran Ghafarian Tamizi and Homayoun Najjaran},
  journal= {arXiv preprint arXiv:2408.07962},
  year   = {2024}
}

备注

Main text accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024, 10 pages, 4 figures, 3 tables