ExTra:迁移引导的探索
机器学习
2020-05-28 v3 机器学习
摘要
在这项工作中,我们提出了一种用于强化学习中迁移引导探索的新方法,其灵感来源于人类在应对新任务时倾向于利用过去相似经历的经验。给定一个相关任务环境中的最优策略,我们证明其与当前任务环境的互模拟距离为当前任务环境中状态-动作对的最优优势提供了一个下界。迁移引导探索(ExTra)根据这些下界的 Softmax 分布来采样动作。通过这种方式,具有潜在更高最优优势的动作被更频繁地采样。我们在网格世界环境中的实验表明,在能够获取相关任务环境中最优策略的条件下,ExTra 在收敛速度上可以优于流行的特定领域探索策略,即 epsilon 贪婪、基于模型的区间估计-探索奖励(MBIE-EB)、Pursuit 和 Boltzmann。我们进一步证明,ExTra 对源任务的选择具有鲁棒性,并且随着源任务不相似度的增加,其性能表现出优雅的退化。我们还证明,当 ExTra 与传统探索算法一起使用时,可以提高它们的收敛速度。因此,它能够补充传统探索算法的有效性。
引用
@article{arxiv.1906.11785,
title = {ExTra: Transfer-guided Exploration},
author = {Anirban Santara and Rishabh Madan and Balaraman Ravindran and Pabitra Mitra},
journal= {arXiv preprint arXiv:1906.11785},
year = {2020}
}
备注
Published as an extended abstract at AAMAS 2020