中文

在具有不完整和噪声观测的 POMDP 中的鲁棒强化学习

机器学习 2019-02-18 v1 人工智能 机器学习

摘要

在真实场景中,用于连续控制强化学习的观测数据通常是带噪的,且其中一部分可能随时间动态缺失,这违背了许多为此开发的现有方法的假设。我们在部分可观测马尔可夫决策过程(POMDP)的框架内使用基于模型的方法解决了该问题,其中使用新提出的具有局部近似的代理损失函数从不完整和带噪的观测中估计转移模型,同时借助信念补全学习策略和价值函数。为了实现后者目的,构建了一个生成模型并无缝整合到 POMDP 的信念更新过程中,从而即使在严重的不完整性和噪声下也能实现鲁棒执行。所提方法的有效性在一系列基准任务上得到了验证,结果表明我们的方法在各种具有挑战性的场景下优于几种对比方法。

关键词

引用

@article{arxiv.1902.05795,
  title  = {Robust Reinforcement Learning in POMDPs with Incomplete and Noisy Observations},
  author = {Yuhui Wang and Hao He and Xiaoyang Tan},
  journal= {arXiv preprint arXiv:1902.05795},
  year   = {2019}
}