ELDEN:基于局部依赖的探索
机器学习
2023-10-16 v1 人工智能
机器人学
摘要
具有大状态空间和稀疏奖励的任务对强化学习提出了长期存在的挑战。在这些任务中,智能体需要高效地探索状态空间直到找到奖励。为应对该问题,学界已提出用内在奖励来增强奖励函数,即一种鼓励智能体访问有趣状态的额外信号。在本工作中,我们针对具有因子化状态空间和复杂链式依赖的环境,提出了一种定义有趣状态的新方法,其中智能体的动作可能改变某一实体的值,而该实体又可能依次影响另一实体的值。我们的洞见是,在这些环境中,用于探索的有趣状态是智能体不确定(而非不确定如何)诸如智能体或物体等实体之间是否相互影响的那些状态。我们提出 ELDEN(Exploration via Local DepENdencies,基于局部依赖的探索),一种新颖的内在奖励,鼓励发现实体间的新交互。ELDEN 利用一种新颖方案——所学动力学的偏导数,以计算高效且准确的方式建模实体间的局部依赖。随后,所预测依赖的不确定性被用作内在奖励,以鼓励朝向新交互的探索。我们在四个具有复杂依赖的不同领域上评估了 ELDEN 的性能,范围从 2D 网格世界到 3D 机器人任务。在所有领域中,ELDEN 正确识别局部依赖并学习到成功的策略,显著优于先前最先进的探索方法。
引用
@article{arxiv.2310.08702,
title = {ELDEN: Exploration via Local Dependencies},
author = {Jiaheng Hu and Zizhao Wang and Peter Stone and Roberto Martin-Martin},
journal= {arXiv preprint arXiv:2310.08702},
year = {2023}
}
备注
Accepted to NeurIPS 2023