中文

S2P:用于离线强化学习数据增强的状态条件图像合成

机器学习 2022-10-03 v1 计算机视觉与模式识别 机器人学

摘要

离线强化学习(Offline RL)由于训练时无法与物理环境交互而受到固有的分布偏移困扰。为缓解此限制,基于状态的离线 RL 利用从记录经验中学习到的动力学模型,并扩充预测的状态转移以扩展数据分布。为在基于图像的 RL 上也能利用此优势,我们首次提出一个生成模型 S2P(State2Pixel),其从对应状态合成智能体的原始像素。它能够在 RL 算法的状态域与图像域之间架起桥梁,并通过状态空间中基于模型的转移虚拟探索未见过的图像分布。通过实验,我们确认基于 S2P 的图像合成不仅提升了基于图像的离线 RL 性能,还展现出对未见任务的强大泛化能力。

关键词

引用

@article{arxiv.2209.15256,
  title  = {S2P: State-conditioned Image Synthesis for Data Augmentation in Offline Reinforcement Learning},
  author = {Daesol Cho and Dongseok Shim and H. Jin Kim},
  journal= {arXiv preprint arXiv:2209.15256},
  year   = {2022}
}

备注

NeurIPS 2022, first two authors contributed equally