基于期望模型的控制规划
人工智能
2021-04-20 v1
摘要
在基于模型的强化学习(MBRL)中,Wan等人(2019)给出了这样的条件:环境模型可以产生下一特征向量的期望,而非完整分布或其样本,且规划性能无损。当环境随机且非平稳、模型为近似模型(例如使用函数逼近学习得到)时,此类期望模型具有研究价值。在这些情况下,完整分布模型可能不切实际,而样本模型要么计算开销更大,要么方差较高。Wan等人仅考虑了用于评估固定策略的预测规划。本文研究控制情形——即通过规划改进并寻找良好的近似策略。我们证明,使用期望模型进行规划必须更新状态值函数,而非如先前所建议的那样更新动作值函数(例如Sorg & Singh, 2010)。这引出了规划如何影响动作选择的问题。我们考量了三种策略,并针对每种策略给出了通用的MBRL算法。我们通过计算实验辨识了这些算法的优势与不足。我们的算法与实验是首个在通用设定下处理带期望模型的MBRL的工作。
引用
@article{arxiv.2104.08543,
title = {Planning with Expectation Models for Control},
author = {Katya Kudashkina and Yi Wan and Abhishek Naik and Richard S. Sutton},
journal= {arXiv preprint arXiv:2104.08543},
year = {2021}
}