R2-Dreamer:无解码器或增强的冗余减少世界模型
机器学习
2026-03-23 v2 人工智能
机器人学
摘要
基于图像的模型基强化学习(MBRL)的核心挑战在于学习从无关视觉细节中提炼出必需信息的表示。虽有前景,但基于重构的方法常在大量与任务无关的区域上浪费容量。无解码器的方法则通过利用数据增强(DA)学习鲁棒表示,但依赖此类外部正则化器限制了其灵活性。我们提出 R2-Dreamer,一种无解码器的 MBRL 框架,采用自监督目标作为内部正则化器,防止表示塌陷,而无需依赖 DA。我们的方法核心是受 Barlow Twins 启发的冗余减少目标,可轻松集成到现有框架中。在 DeepMind Control Suite 和 Meta-World 上,R2-Dreamer 与 DreamerV3 和 TD-MPC2 等强基准方法相当,训练速度比 DreamerV3 快 1.59 倍,并在 DMC-Subtle 上因小任务相关对象而获得显著提升。这些结果表明,有效的内部正则化器可实现灵活、高性能的无解码器 MBRL。代码已公开于 https://github.com/NM512/r2dreamer。
引用
@article{arxiv.2603.18202,
title = {R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation},
author = {Naoki Morihira and Amal Nahar and Kartik Bharadwaj and Yasuhiro Kato and Akinobu Hayashi and Tatsuya Harada},
journal= {arXiv preprint arXiv:2603.18202},
year = {2026}
}
备注
20 pages, 12 figures, 2 tables