预训练视觉表征在基于模型的强化学习关键环节中的泛化
机器人学
2025-09-17 v1 人工智能
机器学习
系统与控制
系统与控制
摘要
在视觉运动策略学习中,机器人智能体的控制策略直接从视觉输入中推导得出。策略和视觉编码器从零开始联合训练的典型方法,对新的视觉场景变化泛化能力较差。使用预训练视觉模型(PVM)为策略网络提供信息,可提高无模型强化学习(MFRL)的鲁棒性。基于模型的强化学习(MBRL)的最新进展表明,MBRL 比 MFRL 具有更高的样本效率。然而,与直觉相反,现有工作发现 PVM 在 MBRL 中效果不佳。在此,我们研究了 PVM 在 MBRL 中的有效性,特别是在视觉域偏移下的泛化能力。我们表明,在存在严重偏移的场景中,PVM 的表现远优于从零开始训练的基线模型。我们进一步研究了不同程度的 PVM 微调的效果。结果表明,在最极端的分布偏移下,部分微调能够保持最高的平均任务性能。我们的结果证明,PVM 在增强视觉策略学习的鲁棒性方面非常成功,为其在基于模型的机器人学习应用中的更广泛采用提供了有力证据。
引用
@article{arxiv.2509.12531,
title = {Pre-trained Visual Representations Generalize Where it Matters in Model-Based Reinforcement Learning},
author = {Scott Jones and Liyou Zhou and Sebastian W. Pattinson},
journal= {arXiv preprint arXiv:2509.12531},
year = {2025}
}