中文

PIPER:基于姿态重标的原始信息偏好层次化强化学习

机器学习 2024-06-18 v2

摘要

本文介绍了PIPER:一种原始信息偏好层次化强化学习方法,通过姿态重标实现。该方法利用偏好学习来学习奖励模型,然后使用该奖励模型来重新标记更高层次的回放缓冲区。由于该奖励不受底层原始行为的影响,我们的重标方法能够缓解现有层次方法中常见的非平稳性问题,并在一系列具有挑战性的稀疏奖励任务中展现出卓越的性能。由于获取人类反馈通常不可行,我们提出用底层原始信息驱动的方法来取代人类在环方法,该方法利用由环境提供的稀疏奖励来生成反馈。此外,为防止不可行的子目标预测和避免退化解,本文提出了原始信息正则化方法,使更高层次策略生成适用于底层策略的可行子目标。我们进行了大量实验,表明PIPER在层次化强化学习中缓解了非平稳性问题,在挑战性稀疏奖励机器人环境中实现了超过50%的成功率,而大多数其他基线几乎无法取得显著进展。

关键词

引用

@article{arxiv.2404.13423,
  title  = {PIPER: Primitive-Informed Preference-based Hierarchical Reinforcement Learning via Hindsight Relabeling},
  author = {Utsav Singh and Wesley A. Suttle and Brian M. Sadler and Vinay P. Namboodiri and Amrit Singh Bedi},
  journal= {arXiv preprint arXiv:2404.13423},
  year   = {2024}
}