中文

自监督学习真的能改进基于像素的强化学习吗?

机器学习 2023-01-18 v4 计算机视觉与模式识别 机器人学

摘要

我们研究自监督学习(SSL)是否能改进基于像素的在线强化学习(RL)。我们扩展了联合优化SSL和RL损失的对比强化学习框架(例如CURL),并使用各种自监督损失进行了大量实验。我们的观察表明,当使用相同数量的数据和增强时,现有的RL用SSL框架未能比仅利用图像增强的基线带来有意义的改进。我们进一步执行进化搜索以寻找用于RL的多个自监督损失的最优组合,但发现即使这样的损失组合也未能有意义地优于仅使用精心设计的图像增强的方法。在包括真实世界机器人环境在内的多个不同环境中共同评估这些方法后,我们确认没有单一的自监督损失或图像增强方法能主导所有环境,并且当前联合优化SSL和RL的框架存在局限。最后,我们对多个因素进行了消融研究,并展示了用不同方法学习到的表示的性质。

关键词

引用

@article{arxiv.2206.05266,
  title  = {Does Self-supervised Learning Really Improve Reinforcement Learning from Pixels?},
  author = {Xiang Li and Jinghuan Shang and Srijan Das and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2206.05266},
  year   = {2023}
}

备注

NeurIPS 2022. Code for ELo-SACv3 is at https://github.com/LostXine/elo-sac and code for ELo-Rainbow is at https://github.com/LostXine/elo-rainbow