中文

小数据集,大收益:通过基于模型增强的离线预训练增强强化学习

机器学习 2023-12-20 v2 人工智能

摘要

离线强化学习利用预先收集的转移数据集来训练策略。它可以作为在线算法的有效初始化,提高样本效率并加快收敛速度。然而,当此类数据集在规模和质量上受限时,离线预训练可能会产生次优策略,并导致在线强化学习性能下降。在本文中,我们提出了一种基于模型的数据增强策略,以最大化离线强化学习预训练的收益并减少达到有效所需的数据规模。我们的方法利用在离线数据集上训练的环境世界模型,在离线预训练期间对状态进行增强。我们在各种 MuJoCo 机器人任务上评估了我们的方法,结果表明它可以快速启动在线微调,并大幅减少所需的环境交互次数——在某些情况下减少了一个数量级。

关键词

引用

@article{arxiv.2312.09844,
  title  = {Small Dataset, Big Gains: Enhancing Reinforcement Learning by Offline Pre-Training with Model Based Augmentation},
  author = {Girolamo Macaluso and Alessandro Sestini and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:2312.09844},
  year   = {2023}
}