中文

强化学习中的预训练视觉表征

机器人学 2024-07-25 v1 机器学习

摘要

视觉强化学习(RL)近年来取得了显著进展,但视觉特征提取器的选择仍是关键设计决策。本文比较了从头训练卷积神经网络(CNN)的RL算法与利用预训练视觉表征(PVRs)的RL算法的性能。我们评估了Dormant Ratio Minimization(DRM)算法——一种最新的视觉RL方法——与三种PVRs(ResNet18、DINOv2和Visual Cortex)的性能。我们使用Metaworld Push-v2和Drawer-Open-v2任务进行比较。我们的结果表明,是否从头训练相对于使用PVRs来最大化性能是任务依赖的,但PVRs在减少回放缓冲区大小和加快训练速度方面具有优势。我们还发现, dormant ratio 与模型性能之间存在很强的相关性,这凸显了视觉RL中探索的重要性。我们的研究提供了关于从头训练与使用PVRs之间的权衡见解,为未来视觉RL算法的设计提供了指导。

关键词

引用

@article{arxiv.2407.17238,
  title  = {Pretrained Visual Representations in Reinforcement Learning},
  author = {Emlyn Williams and Athanasios Polydoros},
  journal= {arXiv preprint arXiv:2407.17238},
  year   = {2024}
}