中文

具收敛性保证的谱风险安全强化学习

机器学习 2024-05-30 v1 人工智能

摘要

风险约束强化学习(RCRL)领域通过显式处理风险度量约束来有效降低最坏情形的发生概率。然而,风险度量的非线性使实现收敛性和最优性方面面临挑战。为克服这种非线性带来的困难,我们提出了一种谱风险度量约束的 RL 算法——谱风险约束策略优化(SRCPO),这是一种双层优化方法,利用谱风险度量的对偶性。在双层优化结构中,外层问题涉及来自风险度量的对偶变量优化,而内层问题涉及在这些对偶变量给定的情况下寻找最优策略。据我们所知,所提出的方法是首个在表格设置下保证收敛至最优解的方法。此外,所提方法在连续控制任务上进行了评估,表现优于满足约束条件的其他 RCRL 算法。

关键词

引用

@article{arxiv.2405.18698,
  title  = {Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees},
  author = {Dohyeong Kim and Taehyun Cho and Seungyub Han and Hojun Chung and Kyungjae Lee and Songhwai Oh},
  journal= {arXiv preprint arXiv:2405.18698},
  year   = {2024}
}

备注

26 pages