动态动作空间强化学习中的动作拾取
机器学习
2023-04-04 v1 人工智能
摘要
大多数强化学习算法基于马尔可夫决策过程(MDP)平稳的关键假设。然而,具有动态动作空间的非平稳 MDP 在真实场景中无处不在。尽管已有许多先前工作研究动态动作空间强化学习问题,但如何从新的未见动作中选择有价值动作以提升学习效率仍未被解决。为应对该问题,我们提出一种智能动作拾取(AP)算法,从一组新动作中自主选择最有可能提升性能的有价值动作。本文首先进行理论分析并发现,先验最优策略通过提供有用知识与经验在动作拾取中起重要作用。随后,基于先验最优策略设计了两种不同 AP 方法:基于频率的全局方法与基于状态聚类的局部方法。最后,我们在两个动作空间随时间变化的仿真但具挑战性的环境中评估 AP。实验结果表明,所提 AP 在学习效率上优于基线。
引用
@article{arxiv.2304.00873,
title = {Action Pick-up in Dynamic Action Space Reinforcement Learning},
author = {Jiaqi Ye and Xiaodong Li and Pangjing Wu and Feng Wang},
journal= {arXiv preprint arXiv:2304.00873},
year = {2023}
}