信任哪个模型:评估模型对连续控制任务中强化学习算法性能的影响
机器学习
2022-03-22 v2 机器学习
摘要
对能够以少量试验解决强化学习(RL)问题的算法的需求推动了基于模型的RL方法的发展。近年来,基于模型的算法所报告的性能急剧提升。然而,近期进展有多少源于改进算法、多少源于改进模型尚不清楚。在采用基于模型的方法时,有多种建模选项可供选择,但不同模型的区分特征与特定优势并不明确。本工作的主要贡献恰在于评估模型对RL算法性能的影响。为模型比较之目的,建立了一组常用模型。这些包括神经网络(NNs)、NNs集成、两种不同的贝叶斯NNs(BNNs)近似,即Concrete Dropout NN与Anchored Ensembling,以及高斯过程(GPs)。模型比较在一系列连续控制基准任务上评估。我们的结果显示模型性能确实存在显著差异。Concrete Dropout NN持续报告更优性能。我们总结这些差异以裨益建模者,并建议模型选择应迎合每个特定应用所需的标准。
引用
@article{arxiv.2110.13079,
title = {Which Model to Trust: Assessing the Influence of Models on the Performance of Reinforcement Learning Algorithms for Continuous Control Tasks},
author = {Giacomo Arcieri and David Wölfle and Eleni Chatzi},
journal= {arXiv preprint arXiv:2110.13079},
year = {2022}
}