物理信息强化学习用于最大安全概率估计
系统与控制
2024-12-31 v1 机器学习
系统与控制
摘要
精确的风险量化和可达性分析对于安全控制与学习至关重要,但从罕见事件、危险状态或长期轨迹中采样可能成本过高。受此启发,我们研究如何在没有足够危险状态和长期轨迹样本覆盖的情况下,估计最大安全动作的长期安全概率。在控制和学习中使用最大安全概率有望避免因风险过度近似而导致的保守行为。在此,我们首先证明,在时间上具有乘性的长期安全概率可以转换为加性代价,并可使用标准强化学习方法求解。然后,我们将此概率推导为偏微分方程的解,并提出物理信息强化学习算法。所提方法能够利用稀疏奖励进行学习,因为物理约束有助于通过邻近状态传播风险信息。这表明,为了提取更多信息以实现高效学习,物理约束可以作为奖励塑形的替代方案。所提方法还可以利用短期样本估计长期风险,并推断未采样状态的风险。这一特性与需要充足数据覆盖的无约束深度强化学习形成鲜明对比。数值仿真验证了所提方法的这些优点。
引用
@article{arxiv.2403.16391,
title = {Physics-informed RL for Maximal Safety Probability Estimation},
author = {Hikaru Hoshino and Yorie Nakahira},
journal= {arXiv preprint arXiv:2403.16391},
year = {2024}
}