中文

利用动作序列等价符号先验实现更高效的探索

机器学习 2021-11-09 v2 人工智能

摘要

在强化学习算法中融入先验知识主要仍是一个开放问题。即便关于环境动力学的洞察可得,强化学习传统上仍被用于白板(tabula rasa)设定,必须从零开始探索并学习一切。在本文中,我们考虑利用关于动作序列等价的先验这一问题:即当不同的动作序列产生相同的效果。我们提出一种新的局部探索策略,经校准以最小化碰撞并最大化新状态访问。我们表明,该策略可通过求解一个凸优化问题以极小的代价计算出来。通过在 DQN 中替换常用的 epsilon-greedy 策略,我们在具有不同动力学结构的多个环境中展示了其潜力。

关键词

引用

@article{arxiv.2110.10632,
  title  = {More Efficient Exploration with Symbolic Priors on Action Sequence Equivalences},
  author = {Toby Johnstone and Nathan Grinsztajn and Johan Ferret and Philippe Preux},
  journal= {arXiv preprint arXiv:2110.10632},
  year   = {2021}
}