Dyna 中基于价值估计爬山法的搜索控制
机器学习
2019-07-05 v3 人工智能
机器学习
摘要
Dyna 是一种基于模型的强化学习(RL)架构,其中利用模型生成的模拟经验来更新策略或价值函数。Dyna 的一个关键组件是搜索控制,即生成智能体查询模型所用状态与动作的机制,该机制在很大程度上仍未被充分探索。本工作中,我们提出利用对当前价值函数估计进行爬山(HC)所得轨迹来生成此类状态。这具有从高价值区域传播价值,并抢先更新智能体可能下一步访问区域的价值估计的效果。我们推导了一种用于爬山的含噪投影自然梯度算法,并指出了其与朗之万动力学的联系。我们在四个经典领域通过实证表明,我们的算法 HC-Dyna 能显著改善样本效率。我们研究了搜索控制不同采样分布的性质,发现通过使用从低价值区域向高价值区域攀爬当前价值估计所生成的样本似乎具有特定益处。
引用
@article{arxiv.1906.07791,
title = {Hill Climbing on Value Estimates for Search-control in Dyna},
author = {Yangchen Pan and Hengshuai Yao and Amir-massoud Farahmand and Martha White},
journal= {arXiv preprint arXiv:1906.07791},
year = {2019}
}
备注
IJCAI 2019