中文

深度强化学习中状态新颖性引导的动作持久性

机器学习 2024-09-10 v1 人工智能

摘要

尽管深度强化学习 (DRL) 是一种强大且极具前景的方法,但仍存在样本效率低的问题,可以通过采用更复杂的技术来解决探索-利用困境,从而显著改善这一问题。其中一种技术依赖于动作持久性(即在多个步骤中重复一个动作)。然而,先前利用动作持久性的工作要么应用固定策略,要么学习额外的价值函数(或策略)来选择重复次数。在本文中,我们提出了一种新方法,根据状态空间当前的探索状态动态调整动作持久性。这样,我们的方法不需要训练额外的价值函数或策略。此外,使用平滑的重复概率调度可以在探索和利用之间实现更有效的平衡。而且,我们的方法可以无缝集成到各种基本探索策略中,以融入时间持久性。最后,在不同 DMControl 任务上的大量实验表明,我们状态新颖性引导的动作持久性方法显著提高了样本效率。

关键词

引用

@article{arxiv.2409.05433,
  title  = {State-Novelty Guided Action Persistence in Deep Reinforcement Learning},
  author = {Jianshu Hu and Paul Weng and Yutong Ban},
  journal= {arXiv preprint arXiv:2409.05433},
  year   = {2024}
}

备注

Under review