中文

DeepSynth:面向深度强化学习中自动任务分割的自动机合成

机器学习 2021-03-09 v5 人工智能 计算机科学中的逻辑 机器学习

摘要

本文提出DeepSynth,一种在奖励稀疏且非马尔可夫、但同时朝向奖励的进展需要实现未知的高层目标序列时,有效训练深度强化学习(RL)智能体的方法。我们的方法采用一种新颖的紧凑自动机合成算法来自动揭示该序列结构。我们从探索环境收集的轨迹数据中合成一个人类可解释的自动机。随后将环境的状态空间用合成自动机加以丰富,从而由深度RL生成控制策略时受编码于自动机中的已发现结构引导。所提方法能够处理高维低层特征以及未知的稀疏非马尔可夫奖励。我们在一组包含Atari游戏Montezuma's Revenge的实验中评估了DeepSynth的性能。与现有方法相比,我们将策略合成所需的迭代次数减少了两个数量级,并且可扩展性也得到显著提升。

关键词

引用

@article{arxiv.1911.10244,
  title  = {DeepSynth: Automata Synthesis for Automatic Task Segmentation in Deep Reinforcement Learning},
  author = {Mohammadhosein Hasanbeig and Natasha Yogananda Jeppu and Alessandro Abate and Tom Melham and Daniel Kroening},
  journal= {arXiv preprint arXiv:1911.10244},
  year   = {2021}
}

备注

Extended version of AAAI 2021 paper