中文

加速目标条件强化学习算法与研究

机器学习 2025-11-25 v4 人工智能

摘要

自监督学习有潜力在强化学习(RL)中实现突破,与在其他机器学习领域的突破一样。虽然自监督学习在其他领域旨在发现固定数据集中的模式,但自监督目标条件强化学习(GCRL)智能体通过学习在与环境非结构化互动期间实现的目标来发现新行为。然而,这些方法由于缺乏来自缓慢环境仿真的数据以及缺乏稳定算法,未能取得类似成功。我们通过发布高性能代码库和基准(JaxGCRL)迈出了解决这两个问题的一步。通过利用 GPU 加速的回放缓冲区、环境以及稳定的对比 RL 算法,我们将训练时间缩短最高可达 22×22\times。此外,我们评估了对比 RL 中关键设计选择,确定最有效稳定和提升训练性能的选项。通过这一方法,我们为未来在自监睈 GCRL 领域的研究提供了基础,使研究者能够快速迭代新想法并在多样化且具挑战性的环境中对其进行评估。网站 + 代码:https://github.com/MichalBortkiewicz/JaxGCRL

关键词

引用

@article{arxiv.2408.11052,
  title  = {Accelerating Goal-Conditioned RL Algorithms and Research},
  author = {Michał Bortkiewicz and Władysław Pałucki and Vivek Myers and Tadeusz Dziarmaga and Tomasz Arczewski and Łukasz Kuciński and Benjamin Eysenbach},
  journal= {arXiv preprint arXiv:2408.11052},
  year   = {2025}
}

备注

Published at ICLR 2025 (Spotlight). Website: https://michalbortkiewicz.github.io/JaxGCRL/ Code: https://github.com/MichalBortkiewicz/JaxGCRL