Dyna-T:将Dyna-Q与上置信界应用于树结构
机器学习
2022-01-20 v2 人工智能
摘要
本文对一种称为 Dyna-T 的新算法进行了初步研究。在强化学习(RL)中,规划智能体拥有其对环境自身的模型表示。为发现与环境交互的最优策略,智能体以试错方式收集经验。经验可用于学习更好的模型,或直接改进价值函数与策略。Dyna-Q 是一种通常分离的混合方法,在每次迭代中利用真实经验更新模型与价值函数,同时使用其模型中的模拟数据进行动作规划。然而,规划过程计算代价高昂,且强烈依赖于状态-动作空间的维度。我们提出在模拟经验上构建上置信树(UCT)并搜索在线学习过程中待选择的最优动作。我们在 Open AI 的三个测试环境上通过一组初步测试证明了所提方法的有效性。与 Dyna-Q 不同,Dyna-T 在随机环境中通过选择更鲁棒的动作选择策略优于 SOTA RL 智能体。
引用
@article{arxiv.2201.04502,
title = {Dyna-T: Dyna-Q and Upper Confidence Bounds Applied to Trees},
author = {Tarek Faycal and Claudio Zito},
journal= {arXiv preprint arXiv:2201.04502},
year = {2022}
}