中文

利用凭证经验回放实现稀疏奖励环境下的选项学习

人工智能 2026-02-17 v1 机器学习 机器人学

摘要

层次强化学习(HRL)框架如Option-Critic(OC)和Multi-updates Option Critic(MOC)在可重用选项的学习方面取得了显著进展。然而,这些方法在奖励稀疏的多目标环境中表现不佳,因而动作必须与时间上相距较远的结果相关联。为解决这一局限性,我们首先提出MOC-HER,将Hindsight Experience Replay(HER)机制集成到MOC框架中。通过对达成结果的目标进行重新标记,MOC-HER能够解决原始MOC难以解决的稀疏奖励环境。然而,这种方法对于物体操作任务仍不够,因为奖励取决于物体到达目标而非主体的直接交互。这使得HRL智能体极难发现如何与这些物体交互。为克服这一问题,我们引入Dual Objectives Hindsight Experience Replay(2HER),一种新型扩展,创建两个虚拟目标集合。除了基于物体最终状态重新标记目标(标准HER)外,2HER还从主体的effector位置生成目标,奖励主体在与物体交互和完成任务方面的表现。在机器人操作环境中的实验结果表明,MOC-2HER的成功率可达90%,而MOC和MOC-HER的成功率不足11%。这些结果凸显了在稀疏奖励、多目标任务中采用双目标重新标记策略的有效性。

关键词

引用

@article{arxiv.2602.13865,
  title  = {Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay},
  author = {Gabriel Romio and Mateus Begnini Melchiades and Bruno Castro da Silva and Gabriel de Oliveira Ramos},
  journal= {arXiv preprint arXiv:2602.13865},
  year   = {2026}
}