中文

强化学习中外生状态变量与奖励的发现与去除

机器学习 2018-06-06 v1 机器学习

摘要

外生状态变量与奖励会通过向奖励信号中注入不受控的变化而拖慢强化学习。我们形式化了外生状态变量与奖励,并识别出一类条件,使得带外生状态的 MDP 可分解为仅涉及外生状态+奖励的外生马尔可夫奖励过程,以及仅基于内生的奖励定义的内生马尔可夫决策过程。我们还推导了一个方差-协方差条件,在此条件下对内生的 MDP 进行蒙特卡洛策略评估相较于使用完整 MDP 得以加速。类似的加速很可能延续至所有 RL 算法。我们开发了两种用于发现外生变量的算法,并在多个 MDP 上进行了测试。结果表明这些算法具有实用性,并能显著加速强化学习。

关键词

引用

@article{arxiv.1806.01584,
  title  = {Discovering and Removing Exogenous State Variables and Rewards for Reinforcement Learning},
  author = {Thomas G. Dietterich and George Trimponias and Zhitang Chen},
  journal= {arXiv preprint arXiv:1806.01584},
  year   = {2018}
}

备注

To appear at ICML 2018