利用前驱与后继表示的最大状态熵探索
机器学习
2023-06-27 v1
摘要
动物具备发达探索能力,助其在定位食物、探寻庇护所和寻找错置物品等重要任务中获益。这些探索技能必然追踪其曾到之处,从而能相对高效地规划寻找物品。当代探索算法常习得效率较低的策略,因为它们或仅以当前状态为条件,或仅依赖随机开环探索动作。本工作中,我们提出 -Learning,一种通过以过往回合经验为条件来决定下一步探索动作、从而学习高效探索策略的方法。具体而言,-Learning 学习一种探索策略,使单条轨迹的状态访问分布熵最大化。此外,我们展示了如何将前驱表示与后继表示的变体结合以预测状态访问熵。我们的实验证明了 -Learning 在有限样本下策略性探索环境并最大化状态覆盖的有效性。
引用
@article{arxiv.2306.14808,
title = {Maximum State Entropy Exploration using Predecessor and Successor Representations},
author = {Arnav Kumar Jain and Lucas Lehnert and Irina Rish and Glen Berseth},
journal= {arXiv preprint arXiv:2306.14808},
year = {2023}
}