预训练视觉表征在基于模型的强化学习中的奇异无效性
机器学习
2025-01-16 v2 人工智能
计算机视觉与模式识别
摘要
视觉强化学习(RL)方法通常需要大量数据。与无模型RL不同,基于模型的RL(MBRL)通过规划提供了数据高效利用的潜在解决方案。此外,RL缺乏对真实任务的泛化能力。先前的工作表明,纳入预训练视觉表征(PVRs)可提高样本效率和泛化性。虽然PVRs在无模型RL的背景下已广泛研究,但其在MBRL中的潜力仍未得到充分探索。本文在基于模型的RL设置中对一组PVRs进行基准测试。我们研究了数据效率、泛化能力以及PVRs属性对基于模型的智能体性能的影响。我们的结果或许令人惊讶地显示,对于MBRL当前的PVRs在样本效率上不比从头学习表征更高,也不比在超出分布(OOD)设置下更好。为解释这一现象,我们分析了训练dynamics模型的质量。我们进一步表明,数据多样性和网络架构是OOD泛化性能最重要的贡献者。
引用
@article{arxiv.2411.10175,
title = {The Surprising Ineffectiveness of Pre-Trained Visual Representations for Model-Based Reinforcement Learning},
author = {Moritz Schneider and Robert Krug and Narunas Vaskevicius and Luigi Palmieri and Joschka Boedecker},
journal= {arXiv preprint arXiv:2411.10175},
year = {2025}
}
备注
Published at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024). Project page: https://schneimo.com/pvr4mbrl/