一种具有目标可达保证的智能体设计以增强学习
人工智能
2024-08-23 v3 系统与控制
系统与控制
动力系统
摘要
强化学习通常关注在马尔可夫决策过程中最大化累积奖励的问题。通常,某个目标状态或状态空间的子集获得最大奖励。在这种情况下,当达到目标时,环境可被视为已解决。尽管存在众多基于学习或非学习的技术用于解决环境,但最优地解决环境是最大的挑战。例如,可以选择一个惩罚动作努力的奖励率。强化学习是目前最活跃的开发框架之一,通过最大化累积奖励(即回报)来最优地解决环境。然而,正如一系列工作所报道的,调整智能体是一项出了名的困难任务。我们的目标是帮助智能体高效地学习接近最优的策略,同时确保某个仅解决环境的基础策略具有目标可达属性。我们提出了一种相当灵活的算法,可用于增强几乎任何包含评论家的智能体。提供了目标可达属性的形式化证明。在流行的基线智能体下对几个问题的比较实验提供了经验证据,表明在确保目标可达属性的同时,学习确实可以得到促进。
引用
@article{arxiv.2405.18118,
title = {An agent design with goal reaching guarantees for enhancement of learning},
author = {Pavel Osinenko and Grigory Yaremenko and Georgiy Malaniya and Anton Bolychev and Alexander Gepperth},
journal= {arXiv preprint arXiv:2405.18118},
year = {2024}
}