中文

基于深度变分推断学习离散状态抽象

机器学习 2021-01-12 v3 机器学习

摘要

在具有大状态空间的领域中,抽象对于有效的序贯决策至关重要。在这项工作中,我们提出一种信息瓶颈方法,用于学习近似互模拟(一种状态抽象)。我们使用深度神经编码器将状态映射到连续嵌入。我们利用动作条件隐马尔可夫模型将这些嵌入映射到离散表示,该模型与神经网络端到端联合训练。我们的方法适用于具有高维状态的环境,并从智能体在马尔可夫决策过程中行动所收集的经验流中学习。通过这一学到的离散抽象模型,我们能够在多目标强化学习设定中高效规划未见目标。我们在具有图像状态的简化机器人操作领域中测试了我们的方法。我们还将其与先前在离散类网格世界中寻找互模拟的基于模型的方法进行比较。源代码可在 https://github.com/ondrejba/discrete_abstractions 获取。

关键词

引用

@article{arxiv.2003.04300,
  title  = {Learning Discrete State Abstractions With Deep Variational Inference},
  author = {Ondrej Biza and Robert Platt and Jan-Willem van de Meent and Lawson L. S. Wong},
  journal= {arXiv preprint arXiv:2003.04300},
  year   = {2021}
}

备注

15 pages, 7 figures