中文

不同设定下基于价值的决策时与背景规划方法之比较考察

机器学习 2024-08-13 v3 人工智能

摘要

在基于模型的强化学习(RL)中,智能体可利用所学模型以不同方式改进其行为方式。两种盛行的做法是借助决策时规划和背景规划方法。在本研究中,我们旨在理解这两类规划方法的基于价值的版本在不同设定下彼此相较表现如何。为此,我们首先考虑基于价值的决策时与背景规划方法的最简实例,并从理论上给出在常规RL与迁移学习设定下何者表现更优的结果。接着,我们考虑它们的现代实例,并就相同设定下何者表现更优提出假设。最后,我们进行说明性实验以验证这些理论结果与假设。总体而言,我们的发现表明:尽管这两类规划方法的基于价值版本在其最简实例下表现相当,但基于价值的决策时规划方法的现代实例在常规RL与迁移学习设定下均可表现与基于价值的背景规划方法的现代实例相当或更佳。

关键词

引用

@article{arxiv.2206.08442,
  title  = {A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings},
  author = {Safa Alver and Doina Precup},
  journal= {arXiv preprint arXiv:2206.08442},
  year   = {2024}
}

备注

Accepted to EWRL 2024