中文

倒置强化学习在带片段重置的随机环境中可能发散

机器学习 2022-05-16 v1 人工智能 机器学习

摘要

倒置强化学习(UDRL)是一种求解 RL 问题的方法,它不需要值函数,仅使用监督学习,且数据集中给定输入的标签不随时间改变。Ghosh 等人证明了目标条件监督学习(GCSL)——可视为 UDRL 的简化版——优化了一个目标可达性能的下界。这让人期望此类算法可能像某些知名传统 RL 算法一样,在任意环境中保证收敛到最优策略。本文表明,对于一种特定的片段式 UDRL 算法(eUDRL,含 GCSL),情况并非如此,并给出此局限性的成因。为此,我们首先引入将 eUDRL 重写为递归策略更新的有用形式。该表述有助于反驳其在广泛一类随机环境中收敛到最优策略。最后,我们给出一个极简单环境的具体例子,其中 eUDRL 发散。由于本文主要目的是给出一个否定性结果,且最佳反例是最简单的,我们将所有讨论限于有限(离散)环境,忽略函数逼近与有限样本量的问题。

关键词

引用

@article{arxiv.2205.06595,
  title  = {Upside-Down Reinforcement Learning Can Diverge in Stochastic Environments With Episodic Resets},
  author = {Miroslav Štrupl and Francesco Faccio and Dylan R. Ashley and Jürgen Schmidhuber and Rupesh Kumar Srivastava},
  journal= {arXiv preprint arXiv:2205.06595},
  year   = {2022}
}

备注

presented at the 5th Multidisciplinary Conference on Reinforcement Learning and Decision Making; 5 pages in main text + 1 page of references + 3 pages of appendices, 1 figure in main text; source code available at https://github.com/struplm/UDRL-GCSL-counterexample.git