在学习的行为空间中探索与利用稀疏奖励
机器学习
2023-09-28 v2 人工智能
神经与进化计算
机器人学
摘要
在稀疏奖励环境中学习最优策略是困难的,因为学习智能体对其动作的质量几乎没有反馈。在这些情况下,一个好的策略是专注于探索,以期发现一个可供改进的奖励信号。能够处理此类环境的算法必须能够(1)探索可能的智能体行为,以及(2)利用任何可能发现的奖励。已有高效的探索算法被提出,这些算法需要定义一个行为空间,将智能体及其产生的行为关联到一个已知值得探索的空间中。定义此空间的需求是这些算法的一个局限。在这项工作中,我们引入了STAX,这是一种旨在动态学习行为空间并对其进行探索,同时高效优化任何已发现奖励的算法。它通过一个交替的两步过程,将行为空间的探索和学习与奖励的利用分离开来。在第一步中,STAX构建一个多样化策略库,同时学习在策略评估过程中产生的高维观测的低维表示。在利用步骤中,使用发射器来优化已发现的有奖励解的性能。在三个不同的稀疏奖励环境中进行的实验表明,STAX的性能与现有基线相当,但由于其自主构建行为空间,所需的任务先验信息要少得多。
引用
@article{arxiv.2111.01919,
title = {Discovering and Exploiting Sparse Rewards in a Learned Behavior Space},
author = {Giuseppe Paolo and Miranda Coninx and Alban Laflaquière and Stephane Doncieux},
journal= {arXiv preprint arXiv:2111.01919},
year = {2023}
}
备注
25 pages. Published by the Evolutionary Computation Journal, MIT Press