中文

多环境中基于好奇心与熵驱动的无监督强化学习

机器学习 2024-01-10 v1 人工智能

摘要

《多环境中的无监督强化学习》的作者提出了一种名为 alpha-MEPOL 的方法,用于处理跨多环境的无监督强化学习。他们利用来自整个环境类的交互来预训练一个任务无关的探索策略,然后使用监督对该策略进行微调以适应各种任务。我们在此基础上进行了扩展,目标是提升性能。我们主要提出并实验了针对原工作的五项新改进:使用基于熵的概率分布采样轨迹、动态 alpha、更高的 KL 散度阈值、好奇心驱动的探索,以及基于好奇心的 alpha 百分位采样。动态 alpha 和更高的 KL 散度阈值均较此前工作的基线有显著提升。PDF 采样未能提供任何改进,因为当样本空间较小时,它近似等价于基线方法。在高维环境中,加入好奇心驱动的探索通过鼓励智能体寻求多样化的经验并更多地探索未知领域来增强学习。然而,在探索可能性受限且智能体真正未知事物很少的低维和简单环境中,其益处有限。总体而言,我们的部分实验确实提升了基线性能,并且存在一些有望进一步研究的方向。

关键词

引用

@article{arxiv.2401.04198,
  title  = {Curiosity & Entropy Driven Unsupervised RL in Multiple Environments},
  author = {Shaurya Dewan and Anisha Jain and Zoe LaLena and Lifan Yu},
  journal= {arXiv preprint arXiv:2401.04198},
  year   = {2024}
}