具收敛性保证的谱风险安全强化学习
机器学习
2024-05-30 v1 人工智能
摘要
风险约束强化学习(RCRL)领域通过显式处理风险度量约束来有效降低最坏情形的发生概率。然而,风险度量的非线性使实现收敛性和最优性方面面临挑战。为克服这种非线性带来的困难,我们提出了一种谱风险度量约束的 RL 算法——谱风险约束策略优化(SRCPO),这是一种双层优化方法,利用谱风险度量的对偶性。在双层优化结构中,外层问题涉及来自风险度量的对偶变量优化,而内层问题涉及在这些对偶变量给定的情况下寻找最优策略。据我们所知,所提出的方法是首个在表格设置下保证收敛至最优解的方法。此外,所提方法在连续控制任务上进行了评估,表现优于满足约束条件的其他 RCRL 算法。
引用
@article{arxiv.2405.18698,
title = {Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees},
author = {Dohyeong Kim and Taehyun Cho and Seungyub Han and Hojun Chung and Kyungjae Lee and Songhwai Oh},
journal= {arXiv preprint arXiv:2405.18698},
year = {2024}
}
备注
26 pages