基于无模型深度强化学习调整模型基强化学习的自适应展开长度
机器学习
2022-06-08 v2 人工智能
摘要
与无模型强化学习相比,模型基强化学习(model-based reinforcement learning)有望通过习得环境的中间模型以预测未来交互,从而从更少的环境交互中学习到最优策略。在预测交互序列时,限制预测视野的展开长度(rollout length)是一个关键超参数,因为预测的精度在远离真实经验的区域会下降。因此,较长的展开长度从长远来看会学到整体更差的策略。故此,该超参数在质量与效率之间提供了权衡。在本工作中,我们将调整展开长度的问题构建为一个元级序贯决策问题,其在给定固定环境交互预算下,基于学习过程的反馈(如模型的精度与剩余交互预算)动态适配该超参数,以优化模型基强化学习所学得的最终策略。我们使用无模型深度强化学习求解该元级决策问题,并证明我们的方法在两个知名强化学习环境上优于常见的启发式基线。
引用
@article{arxiv.2206.02380,
title = {Adaptive Rollout Length for Model-Based RL Using Model-Free Deep RL},
author = {Abhinav Bhatia and Philip S. Thomas and Shlomo Zilberstein},
journal= {arXiv preprint arXiv:2206.02380},
year = {2022}
}