通过学习不良轨迹的时间模式并规避负面副作用实现安全MDP规划
机器学习
2023-04-07 v1 人工智能
摘要
在安全MDP规划中,常基于当前状态与动作的成本函数来指定安全方面。在真实世界中,所使用的状态表示往往缺乏足够保真度来指定此类安全约束。基于不完备模型运行常会产生非预期的负面副作用(NSEs)。为应对这些挑战,首先,我们将安全信号与状态-动作轨迹(而非仅即时状态-动作)相关联,这使我们的安全模型具有高度通用性。我们还假设对不同轨迹给出类别型安全标签,而非数值成本函数,后者更难由问题设计者指定。随后我们采用监督学习模型来学习此类非马尔可夫安全模式。其次,我们发展了拉格朗日乘子方法,将安全模型与底层MDP模型纳入单一计算图以促成智能体学习安全行为。最后,我们在多种离散与连续域上的实证结果表明,该方法能在优化智能体总回报的同时满足复杂的非马尔可夫安全约束,具有高度可扩展性,并且优于先前针对马尔可夫NSEs的最佳方法。
引用
@article{arxiv.2304.03081,
title = {Safe MDP Planning by Learning Temporal Patterns of Undesirable Trajectories and Averting Negative Side Effects},
author = {Siow Meng Low and Akshat Kumar and Scott Sanner},
journal= {arXiv preprint arXiv:2304.03081},
year = {2023}
}