ExPoSe:将基于状态的探索与基于梯度的在线搜索相结合
人工智能
2023-03-07 v4 机器学习
摘要
在线基于树的搜索算法迭代地模拟轨迹并更新存储在树结构中的一组状态的动作值。它在实践中表现相当好,但未能有效利用从相似状态收集的信息。根据动作值函数的平滑性,克服此问题的一种方法是在线学习,其中信息在相似状态间进行插值;策略梯度搜索提供了一种实现此目标的实用算法。然而,策略梯度搜索缺乏显式探索机制,而这是基于树的在线搜索算法的关键特征。在本文中,我们提出了一种高效且有效的在线搜索算法,称为探索性策略梯度搜索(ExPoSe),它通过直接更新搜索策略参数来利用状态间的信息共享,同时在在线搜索过程中融入定义良好的探索机制。我们在一系列决策问题上评估 ExPoSe,包括 Atari 游戏、推箱子以及稀疏图中的哈密顿圈搜索。结果表明 ExPoSe 在所有领域均持续优于其他流行的在线搜索算法。ExPoSe 源代码可在 \textit{\url{https://github.com/dixantmittal/ExPoSe}} 获取。
引用
@article{arxiv.2202.01461,
title = {ExPoSe: Combining State-Based Exploration with Gradient-Based Online Search},
author = {Dixant Mittal and Siddharth Aravindan and Wee Sun Lee},
journal= {arXiv preprint arXiv:2202.01461},
year = {2023}
}