中文

合成经验回放

机器学习 2023-10-30 v4 人工智能 机器学习

摘要

过去十年的一个关键主题是,当大型神经网络与大型数据集结合时,能够产生卓越的结果。在深度强化学习(RL)中,这一范式通常通过经验回放实现,即使用过去经验的数据集来训练策略或价值函数。然而,与监督学习或无监督学习不同,RL 智能体必须收集自己的数据,而这往往是有限的。因此,很难享受到深度学习的益处,甚至小型神经网络在训练初期就会过拟合。本工作中,我们利用生成建模近期的巨大进展,提出 Synthetic Experience Replay(SynthER),一种基于扩散模型的灵活上采样智能体所收集经验的方法。我们表明 SynthER 是一种在离线和在线设定下、在本体感知与基于像素的环境中训练 RL 智能体的有效方法。在离线设定中,我们观察到对小型离线数据集上采样时有显著改进,并且额外的合成数据也使我们能够有效训练更大的网络。此外,SynthER 使在线智能体能够以比以往高得多的更新-数据比进行训练,从而显著提升样本效率,且无需任何算法改动。我们相信合成训练数据可为基于回放的 RL 算法从有限数据中释放深度学习全部潜力打开大门。最后,我们在 https://github.com/conglu1997/SynthER 开源了代码。

关键词

引用

@article{arxiv.2303.06614,
  title  = {Synthetic Experience Replay},
  author = {Cong Lu and Philip J. Ball and Yee Whye Teh and Jack Parker-Holder},
  journal= {arXiv preprint arXiv:2303.06614},
  year   = {2023}
}

备注

Published at NeurIPS, 2023