中文

稀疏奖励环境中的广义回溯经验回放

机器学习 2024-12-23 v1 人工智能

摘要

回溯经验回放(BER)是一种强化学习技术,可以在可逆环境中加速学习效率。BER 利用收集经验的生成回溯转移和正常前向转移来训练智能体。然而,原始算法是为不需要复杂探索的密集奖励环境设计的,这限制了 BER 技术展示其全部潜力。在本文中,我们提出了 BER 的增强版本,称为广义 BER(GBER),它将原始算法扩展到稀疏奖励环境,特别是那些需要智能体探索的复杂结构环境。GBER 通过引入重标记机制和应用多样化采样策略来提高 BER 的性能。我们基于目标条件深度确定性策略梯度离线学习算法评估了修改后的版本,并在各种迷宫导航环境中进行了测试。实验结果表明,GBER 算法可以显著提升基线算法在各种稀疏奖励环境中的性能和稳定性,尤其是在具有高度结构对称性的环境中。

关键词

引用

@article{arxiv.2412.15525,
  title  = {Generalized Back-Stepping Experience Replay in Sparse-Reward Environments},
  author = {Guwen Lyu and Masahiro Sato},
  journal= {arXiv preprint arXiv:2412.15525},
  year   = {2024}
}