通过剪枝原型目标扩展基于目标的探索
机器学习
2023-02-10 v1 人工智能
摘要
强化学习(RL)中最棘手的挑战之一是可扩展至广阔领域的探索,而追求新颖性或覆盖性的行为在此类情形下表现不足。目标导向的、有目的的行为能够克服这一点,但依赖于良好的目标空间。目标发现的核心挑战在于找到通用性(非手工设计)与可处理性(有用、不过多)之间的正确平衡。我们的方法明确寻求中间地带,使人类设计者能够指定一个广阔而有意义的原型目标空间,并由自主发现过程将其精炼为更窄的可控、可达、新颖且相关的目标空间。随后,在三个具有挑战性的环境中展示了使用后者进行目标条件探索的有效性。
引用
@article{arxiv.2302.04693,
title = {Scaling Goal-based Exploration via Pruning Proto-goals},
author = {Akhil Bagaria and Ray Jiang and Ramana Kumar and Tom Schaul},
journal= {arXiv preprint arXiv:2302.04693},
year = {2023}
}