中文

基于不变因果特征的世界模型对比无监督学习

机器学习 2022-09-30 v1 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

本文提出一种利用不变性原理学习因果特征的世界模型。具体而言,我们使用对比无监督学习来学习不变因果特征,该方法在观测中无关部分或风格的增强之间强制不变性。基于世界模型的强化学习方法独立优化表示学习与策略。因此,朴素的对比损失实现会因表示学习模块缺乏监督信号而崩溃。我们提出一种干预不变辅助任务来缓解此问题。具体地,我们利用深度预测显式强制不变性,并将数据增强作为 RGB 观测空间上的风格干预。我们的设计借助无监督表示学习来学习具有不变因果特征的世界模型。我们提出的方法在 iGibson 数据集的分布外点导航任务上显著优于当前最先进的基于模型与无模型的强化学习方法。此外,我们提出的模型在感知学习模块的仿真到真实迁移上表现出色。最后,我们在 DeepMind control suite 上评估我们的方法,由于深度不可用仅隐式强制不变性。尽管如此,我们提出的模型表现与最先进对应方法相当。

关键词

引用

@article{arxiv.2209.14932,
  title  = {Contrastive Unsupervised Learning of World Model with Invariant Causal Features},
  author = {Rudra P. K. Poudel and Harit Pandya and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2209.14932},
  year   = {2022}
}