RAPTOR:基于反向传播的风险感知 MDP 端到端规划与策略学习
机器学习
2021-06-15 v1
摘要
规划为在复杂环境中优化序贯决策提供了框架。近期在具有连续动作空间的决定性或随机高维域中高效规划的进展,利用通过环境模型的反向传播直接优化动作。然而,现有方法在随机域中优化时通常未考虑风险,而在 MDP 中可通过优化回报的熵效用高效地纳入风险。我们填补了这一空白,提出使用 PyTorch 的风险感知规划(RAPTOR),一种通过端到端优化熵效用目标实现风险敏感规划的新框架。我们方法的一个关键技术难点在于,由于环境随机性的存在,通过反向传播直接优化熵效用是不可能的。RAPTOR 的新颖性在于对状态分布进行重参数化,使得能够通过从前向采样轨迹计算的熵效用充分统计量应用随机反向传播。以端到端方式直接优化该经验目标称为风险厌恶直线规划,其预先确定一系列动作,在高度随机域中可能是次优的。我们在框架中通过优化风险感知深度反应策略(RaDRP)来解决这一缺陷。我们在三个高度随机域(包括非线性导航、HVAC 控制和线性水库控制)上评估并比较了这两种 RAPTOR 形式,展示了在复杂 MDP 中管理风险的能力。
引用
@article{arxiv.2106.07260,
title = {RAPTOR: End-to-end Risk-Aware MDP Planning and Policy Learning by Backpropagation},
author = {Noah Patton and Jihwan Jeong and Michael Gimelfarb and Scott Sanner},
journal= {arXiv preprint arXiv:2106.07260},
year = {2021}
}