基于 MDP 同态的深度学习在线抽象方法
机器学习
2021-04-20 v2 机器学习
摘要
马尔可夫决策过程(MDP)的抽象是解决复杂问题的有用工具,因为它可以忽略环境中不重要的方面,从而简化学习最优策略的过程。在本文中,我们提出了一种在具有连续状态空间的环境中寻找抽象 MDP 的新算法。该算法基于 MDP 同态,即 MDP 之间的保结构映射。我们展示了我们的算法从已收集经验中学习抽象的能力,并说明了如何重用这些抽象来引导智能体在遇到的新任务中的探索。我们的新颖任务迁移方法在大部分实验中优于基于深度 Q 网络(deep Q-network)的基线方法。源代码位于 https://github.com/ondrejba/aamas_19。
引用
@article{arxiv.1811.12929,
title = {Online Abstraction with MDP Homomorphisms for Deep Learning},
author = {Ondrej Biza and Robert Platt},
journal= {arXiv preprint arXiv:1811.12929},
year = {2021}
}