中文

将鲁棒MDP求解作为静态RL问题的序列

机器学习 2024-10-10 v1

摘要

设计在给定阈值范围内性能水平保持稳定的控制策略,是强化学习(RL)在实际应用中采纳的关键特征。寻找此类鲁棒策略的搜索是一个著为难以解决的问题,涉及转换函数动态模型,其中环境动力学允许在每个时间步更改。在实际情况下,人们更关注对一系列静态转换模型的鲁棒性,这些模型在与环境交互的整个过程中保持不变。静态模型比动态模型更难求解,经典算法如鲁棒值迭代,以及大多数最新基于深度鲁棒RL的工作,都建立在动态模型之上。在本工作中,我们重新审视静态模型。我们建议在某些温和假设下,求解静态模型是合理的决策,基于其与动态模型的等价性,并形式化了鲁棒MDP可通过解决一系列静态问题来求解的普遍直观。我们引入一种通用元算法IWOCS,该算法逐步识别最坏情况转换模型,以引导寻找鲁棒策略。对IWOCS的讨论揭示了如何解耦策略优化与对抗性转换函数的新方法,并为分析开辟了新视野。我们推导出IWOCS的深度RL版本,证明其在经典基准测试中与最先进算法相当。

关键词

引用

@article{arxiv.2410.06212,
  title  = {Solving robust MDPs as a sequence of static RL problems},
  author = {Adil Zouitine and Matthieu Geist and Emmanuel Rachelson},
  journal= {arXiv preprint arXiv:2410.06212},
  year   = {2024}
}

备注

12 pages