中文

基于模型的多任务离线预训练强化学习

机器学习 2024-06-06 v3 人工智能 机器人学

摘要

在离线数据集上预训练强化学习(RL)模型是提高其在在线任务中训练效率的一种有前景的方法,但由于不同任务在动态和行为上固有的不匹配而具有挑战性。我们提出了一种基于模型的RL方法,该方法学习将潜在有用的动态和动作演示从离线数据迁移到新任务中。其核心思想是将世界模型不仅用作行为学习的模拟器,还用作衡量动态表征迁移和策略迁移任务相关性的工具。我们构建了一个时变、域选择性的蒸馏损失来生成一组离线到在线的相似度权重。这些权重有两个用途:(i)自适应地迁移物理动态的任务无关知识以促进世界模型训练,以及(ii)学习重放相关的源动作以指导目标策略。我们在Meta-World和DeepMind Control Suite中展示了我们的方法相较于最先进方法的优势。

关键词

引用

@article{arxiv.2306.03360,
  title  = {Model-Based Reinforcement Learning with Multi-Task Offline Pretraining},
  author = {Minting Pan and Yitao Zheng and Yunbo Wang and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2306.03360},
  year   = {2024}
}