受迭代加深搜索启发的带增益调度的奖励激励方法
机器学习
2023-07-04 v1 人工智能
摘要
本文提出了一种在任务导向奖励函数中添加内在激励的新方法,以有效促进强化学习搜索。尽管迄今为止已设计了多种激励,但它们类似于图论中的深度优先和广度优先搜索算法。因此,本文首先为每种算法设计了两种激励。随后,受已知兼具两种搜索算法优点的迭代加深搜索启发,对所设计的激励施加了一种启发式增益调度。所提方法有望使智能体通过逐步探索未知状态,高效到达更深状态中的最优解。在三个带密集奖励的运动任务与三个带稀疏奖励的简单任务中,结果表明两类激励对不同任务的性能提升具有互补作用。此外,通过将它们与所提增益调度相结合,所有任务均能高性能完成。
引用
@article{arxiv.2212.10765,
title = {Reward Bonuses with Gain Scheduling Inspired by Iterative Deepening Search},
author = {Taisuke Kobayashi},
journal= {arXiv preprint arXiv:2212.10765},
year = {2023}
}
备注
10 pages, 7 figures