中文

梦见以泛化:面向未见视觉干扰的零样模型基强化学习

计算机视觉与模式识别 2025-06-09 v1 人工智能

摘要

模型基强化学习(MBRL)已被用于在高维图像观测中高效解决基于视觉的控制任务。尽管最近的 MBRL 算法在训练观测中表现良好,但面对观测中的视觉干扰时会失败。这些任务无关的干扰(如云层、阴影和光线)可能在现实场景中持续存在。本研究提出一种新型自监督方法,即梦见以泛化(Dream to Generalize, Dr. G),用于零样 MBRL。Dr. G 通过双对比学习训练其编码器和世界模型,高效捕捉多视图数据增强中的任务相关特征。我们还引入了一种递归状态逆向动力学模型,有助于世界模型更好地理解时序结构。所提方法可增强世界模型对视觉干扰的鲁棒性。为评估泛化性能,我们首先在简单背景上训练 Dr. G,然后在 DeepMind Control suite 中的复杂自然视频背景以及 Robosuite 中的随机化环境中进行测试。分别相对于先前方法,Dr. G 在性能上提升了 117% 和 14%。我们的代码已开源并可在 https://github.com/JeongsooHa/DrG.git 获取。

关键词

引用

@article{arxiv.2506.05419,
  title  = {Dream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual Distractions},
  author = {Jeongsoo Ha and Kyungsoo Kim and Yusung Kim},
  journal= {arXiv preprint arXiv:2506.05419},
  year   = {2025}
}

备注

AAAI 2023