基于二元反馈的长期安全强化学习
机器学习
2024-01-12 v2 人工智能
机器人学
摘要
安全性是将强化学习(RL)应用于实际问题不可或缺的要求。尽管近年来提出了大量安全 RL 算法,但现有工作大多通常:1) 依赖接收数值安全反馈;2) 不保证学习过程中的安全性;3) 将问题限制在先验已知的确定性状态转移动力学上;和/或 4) 假设对于任何状态都存在已知的安全策略。为了解决上述问题,我们提出了 Long-term Binaryfeedback Safe RL (LoBiSaRL),这是一种针对具有二元安全反馈和未知随机状态转移函数的约束马尔可夫决策过程(CMDP)的安全 RL 算法。LoBiSaRL 优化策略以最大化奖励,同时保证长期安全性,即智能体在每个回合中仅以高概率执行安全的状态-动作对。具体而言,LoBiSaRL 通过广义线性模型(GLM)对二元安全函数进行建模,并在适当假设下推断其对未来安全性的影响,同时在每个时间步保守地仅采取安全动作。我们的理论结果表明,LoBiSaRL 以高概率保证长期安全约束。最后,我们的实验结果证明,我们的算法比现有方法更安全,且未显著降低奖励性能。
关键词
引用
@article{arxiv.2401.03786,
title = {Long-term Safe Reinforcement Learning with Binary Feedback},
author = {Akifumi Wachi and Wataru Hashimoto and Kazumune Hashimoto},
journal= {arXiv preprint arXiv:2401.03786},
year = {2024}
}
备注
Accepted to AAAI-24