ReCoRe:世界模型的正则化对比表示学习
机器学习
2024-04-04 v2 人工智能
计算机视觉与模式识别
机器人学
机器学习
摘要
尽管最近的无模型强化学习(RL)方法在游戏环境中展现了人类水平的有效性,但它们在日常任务(如视觉导航)中的成功有限,特别是在显著外观变化下。这种局限性源于(i)样本效率低和(ii)对训练场景的过拟合。为了解决这些挑战,我们提出了一种世界模型,它使用(i)对比无监督学习和(ii)干预不变正则化器来学习不变特征。学习世界动力学的显式表示(即世界模型)提高了样本效率,而对比学习隐式地强制学习不变特征,从而提高了泛化能力。然而,将对比损失简单集成到世界模型中是不够的,因为基于世界模型的RL方法独立优化表示学习和智能体策略。为了克服这个问题,我们提出了一种干预不变正则化器,形式为辅助任务(如深度预测、图像去噪、图像分割等),显式强制对风格干预的不变性。我们的方法优于当前最先进的基于模型和无模型的RL方法,并在iGibson基准上评估的分布外点导航任务上显著改进。仅凭视觉观察,我们进一步证明我们的方法在点导航方面优于最近的语言引导基础模型,这对于在计算能力有限的机器人上部署至关重要。最后,我们证明我们提出的模型在Gibson基准上其感知模块的模拟到真实迁移中表现出色。
引用
@article{arxiv.2312.09056,
title = {ReCoRe: Regularized Contrastive Representation Learning of World Model},
author = {Rudra P. K. Poudel and Harit Pandya and Stephan Liwicki and Roberto Cipolla},
journal= {arXiv preprint arXiv:2312.09056},
year = {2024}
}
备注
Accepted at CVPR 2024. arXiv admin note: text overlap with arXiv:2209.14932