基于 Wasserstein 约束的安全深度 Q 学习
机器学习
2021-10-27 v4 机器学习
摘要
本文提出了一种分布鲁棒 Q 学习算法(DrQ),其利用 Wasserstein 模糊集,在在线学习期间提供理想化的概率样本外安全保证。首先,我们沿用以往工作,将约束函数与主目标分离,以创建一个机器层次结构,用于估计约束马尔可夫决策过程(CMDP)内的可行状态-动作空间。DrQ 在该框架内工作,通过由 Wasserstein 分布鲁棒优化(DRO)获得的收紧偏移变量来增强约束代价。这些偏移变量对应于由约束 Q 函数的 TD 误差刻画的最坏情况建模误差分布。此过程使我们能够安全地接近名义约束边界。利用锂离子电池快充的案例研究,我们探讨了理想化安全保证如何转化为相对于传统方法普遍改善的安全性。
引用
@article{arxiv.2002.03016,
title = {Safe Wasserstein Constrained Deep Q-Learning},
author = {Aaron Kandel and Scott J. Moura},
journal= {arXiv preprint arXiv:2002.03016},
year = {2021}
}