中文

利用无标签先验数据加速探索

机器学习 2023-11-22 v2 人工智能 机器学习

摘要

从稀疏奖励信号中学习解决任务是标准强化学习(RL)算法的一大挑战。然而在现实世界中,智能体很少需要完全从零开始解决稀疏奖励任务。更常见的是,我们可能拥有可借鉴的先验经验,其提供了关于世界中哪些动作和结果可行的充分指导,可用于为新任务更有效地探索。本工作中,我们研究如何利用无奖励标签的先验数据来引导并加速智能体解决新稀疏奖励任务的探索。我们提出一种简单方法:从在线经验学习奖励模型,以乐观奖励标注无标签先验数据,随后将其与在线数据并行用于下游策略和评论员优化。这一通用范式在多个具有挑战性的稀疏奖励领域实现了快速探索,而白板(tabula rasa)探索不足以应对这些领域,包括 AntMaze 领域、Adroit 手操纵领域以及视觉模拟机器人操纵领域。我们的结果凸显了将无标签先验数据融入现有在线 RL 算法的简便性,以及这样做(或许令人惊讶的)有效性。

关键词

引用

@article{arxiv.2311.05067,
  title  = {Accelerating Exploration with Unlabeled Prior Data},
  author = {Qiyang Li and Jason Zhang and Dibya Ghosh and Amy Zhang and Sergey Levine},
  journal= {arXiv preprint arXiv:2311.05067},
  year   = {2023}
}

备注

25 pages, 16 figures, 37th Conference on Neural Information Processing Systems (NeurIPS 2023)