通过质量-多样性算法在稀疏奖励环境中学习
机器学习
2022-03-03 v1 人工智能
神经与进化计算
摘要
在强化学习 (RL) 框架中,学习通过奖励信号进行引导。这意味着在稀疏奖励的情况下,智能体必须专注于探索,以发现哪个动作或哪组动作能带来奖励。RL 智能体通常在此方面遇到困难。探索是质量-多样性 (QD) 方法的焦点。在本论文中,我们使用这些算法,特别是新颖性搜索 (NS),来解决稀疏奖励问题。这是一种仅关注可能策略行为多样性的方法。论文的第一部分专注于学习一个用于评估策略多样性的空间表示。在这方面,我们提出了 TAXONS 算法,这是一种通过自编码器学习搜索空间低维表示的方法。虽然有效,TAXONS 仍然需要关于何时捕获用于学习该空间的观测信息。为此,我们研究了多种方法,特别是签名变换,来编码关于整个观测轨迹的信息。论文接着介绍了 SERENE 算法,这是一种能有效聚焦于搜索空间中感兴趣部分的方法。该方法通过两步交替的方法将搜索空间的探索与奖励的利用分离开来。探索通过 NS 执行。任何发现的奖励随后通过发射器进行局部利用。第三个也是最后一个贡献将 TAXONS 和 SERENE 结合成一个单一方法:STAX。在本论文中,我们引入了减少稀疏奖励环境中所需先验信息量的方法。这些贡献是朝着开发能够在各种稀疏奖励环境中自主探索并找到高性能策略的方法迈出的有希望的一步。
引用
@article{arxiv.2203.01027,
title = {Learning in Sparse Rewards settings through Quality-Diversity algorithms},
author = {Giuseppe Paolo},
journal= {arXiv preprint arXiv:2203.01027},
year = {2022}
}
备注
PhD Thesis