通过估计最劣核函数引入自有(非鲁棒)算法求解鲁棒 MDP
机器学习
2024-02-13 v2
摘要
鲁棒马尔可夫决策过程(RMDP)为对转移核扰动具有鲁棒性的序列决策提供了框架。然而,当前的 RMDP 方法通常局限于小规模问题,阻碍其在高维领域中的使用。为弥补这一差距,我们提出 EWoK,一种求解 RMDP 的新型在线方法,通过估计最劣转移核(Estimates the Worst transition Kernel)来学习鲁棒策略。与以往对策略或价值更新进行正则化的工作不同,EWoK 通过为智能体模拟最劣场景来实现鲁棒性,同时在学习过程中保持完全灵活性。值得注意的是,EWoK 可应用于任何现成的非鲁棒(non-robust)RL 算法之上,从而轻松扩展至高维领域。我们的实验涵盖从简单的 Cartpole 到高维 DeepMind Control Suite 环境,证明了 EWoK 范式作为学习鲁棒策略的实用方法的有效性与适用性。
引用
@article{arxiv.2306.05859,
title = {Bring Your Own (Non-Robust) Algorithm to Solve Robust MDPs by Estimating The Worst Kernel},
author = {Kaixin Wang and Uri Gadot and Navdeep Kumar and Kfir Levy and Shie Mannor},
journal= {arXiv preprint arXiv:2306.05859},
year = {2024}
}