BeBold:在已探索区域边界之外的探索
机器学习
2020-12-17 v1 人工智能
机器学习
摘要
在稀疏奖励下实现高效探索仍是深度强化学习中的关键挑战。为引导探索,先前工作广泛利用内在奖励(IR)。IR存在多种启发式方法,包括访问计数、好奇心和状态差异。本文中,我们分析每种方法的优劣,并提出将逆访问计数的受调节差异作为简单而有效的IR准则。该准则帮助智能体在已探索区域的边界之外(Beyond the Boundary)进行探索,并缓解基于计数的方法中的常见问题,如短视和脱离。所得方法BeBold仅用120M环境步即在MiniGrid中解决了12个最具挑战性的程序生成任务,且无需任何课程学习。相比之下,先前SoTA仅解决了50%的任务。BeBold在流行的包含更具挑战性程序生成环境的 rogue-like 游戏NetHack的多个任务上也达到了SoTA。
引用
@article{arxiv.2012.08621,
title = {BeBold: Exploration Beyond the Boundary of Explored Regions},
author = {Tianjun Zhang and Huazhe Xu and Xiaolong Wang and Yi Wu and Kurt Keutzer and Joseph E. Gonzalez and Yuandong Tian},
journal= {arXiv preprint arXiv:2012.08621},
year = {2020}
}