面向强化学习安全性的堆叠式通用后继特征逼近器
机器学习
2024-09-10 v1 人工智能
摘要
现实世界的问题通常涉及复杂的多目标结构,难以将其提炼为单一目标的强化学习环境。运行成本必须与多维任务性能以及最终状态对未来可用性的影响相平衡,同时还要确保环境中其他智能体以及强化学习智能体自身的安全。在违反约束风险极高的实际应用中,通过辅助备份控制器实现系统冗余已被证明是一种确保安全的有效方法。在这项工作中,我们研究了一种堆叠式、连续控制的通用后继特征逼近(USFA)变体的效用,该变体适用于软演员-评论家(SAC)算法,并与一套辅助安全控制器相结合,我们称之为面向安全性的堆叠式USFA(SUSFAS)。与使用干预性辅助控制器(如运行时保障(RTA)控制器)的SAC基线相比,我们的方法在次要目标上的性能有所提升。
引用
@article{arxiv.2409.04641,
title = {Stacked Universal Successor Feature Approximators for Safety in Reinforcement Learning},
author = {Ian Cannon and Washington Garcia and Thomas Gresavage and Joseph Saurine and Ian Leong and Jared Culbertson},
journal= {arXiv preprint arXiv:2409.04641},
year = {2024}
}
备注
13 pages