中文

MuDreamer:无需重建即可学习预测世界模型

人工智能 2024-05-27 v1 计算机视觉与模式识别

摘要

DreamerV3 智能体最近在多样化领域展示了最先进的性能,通过像重建损失在潜在空间中学习强大的世界模型。然而,尽管重建损失对 Dreamer 的性能至关重要,但它也 necessitates 对不必要信息进行建模。因此,当观察中存在视觉干扰时,Dreamer 有时会忽略那些必要用于任务解决的关键要素,显著限制了其潜力。本文提出了 MuDreamer,一种基于 DreamerV3 算法的鲁棒强化学习智能体,通过无需重建输入信号来学习预测世界模型。我们不依赖像重建,而是通过预测环境价值函数和先前选择的动作来学习隐藏表示。类似于针对图像的预测自监督方法,我们发现批量归一化对于防止学习坍缩至关重要。我们还研究了在模型后验和先验损失之间进行 KL 平衡对收敛速度和学习稳定性的影响。我们在常用的 DeepMind 视觉控制套件上评估了 MuDreamer,证明其对视觉干扰的鲁棒性优于 DreamerV3 和其他无重建方法,后者将环境背景替换为与任务无关的真实世界视频。我们的方法还在 Atari100k 基准上实现了相当好的性能,同时受益于更快的训练速度。

关键词

引用

@article{arxiv.2405.15083,
  title  = {MuDreamer: Learning Predictive World Models without Reconstruction},
  author = {Maxime Burchi and Radu Timofte},
  journal= {arXiv preprint arXiv:2405.15083},
  year   = {2024}
}