中文

利用无标签先验数据的技能实现高效在线探索

机器学习 2025-07-15 v4 人工智能 机器学习

摘要

无监督预训练在许多监督领域已经产生了变革性影响。然而,将此类思想应用于强化学习(RL)提出了一个独特的挑战,因为微调不涉及模仿特定任务的数据,而是通过迭代自我改进来探索和定位解决方案。在这项工作中,我们研究了如何利用无标签的离线轨迹数据来学习高效的探索策略。虽然先验数据可用于预训练一组低级技能,或作为在线RL的额外离策略数据,但目前尚不清楚如何有效地结合这些思想以进行在线探索。我们的方法SUPE(利用无标签先验数据的技能进行探索)表明,这些思想的巧妙结合可以放大它们的益处。我们的方法首先使用变分自编码器(VAE)提取低级技能,然后用乐观奖励和高级动作标签对无标签轨迹进行伪标记,将先验数据转化为高级的、与任务相关的示例,从而鼓励寻求新奇的行为。最后,SUPE将这些转换后的示例作为在线RL的额外离策略数据,以学习一个高级策略,该策略组合预训练的低级技能以进行高效探索。在我们的实验中,SUPE在42个长时域、稀疏奖励任务中始终优于先前的策略。代码:https://github.com/rail-berkeley/supe。

关键词

引用

@article{arxiv.2410.18076,
  title  = {Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration},
  author = {Max Wilcoxson and Qiyang Li and Kevin Frans and Sergey Levine},
  journal= {arXiv preprint arXiv:2410.18076},
  year   = {2025}
}

备注

28 pages, 20 figures, 42nd International Conference on Machine Learning (ICML 2025)