中文

DyMoDreamer:基于动态调制的世界模型

机器学习 2025-09-30 v1

摘要

深度强化学习 (DRL) 的一个关键瓶颈是样本低效,因为训练高性能智能体通常需要大量的环境交互。基于模型的强化学习 (MBRL) 通过构建模拟环境动态并生成合成经验的世界模型来缓解这一问题,从而提高样本效率。然而,传统的世界模型整体处理观测,未能将动态物体和时间特征与静态背景解耦。这种方法在计算上效率低下,特别是对于动态物体显著影响奖励和决策性能的视觉任务。为了解决这一问题,我们引入了DyMoDreamer,一种结合动态调制机制以改善动态特征提取并丰富时间信息的新型MBRL算法。DyMoDreamer采用由新型帧间差分掩码导出的差分观测,显式编码物体级运动线索和时间动态。动态调制被建模为随机类别分布,并集成到循环状态空间模型 (RSSM) 中,增强了模型对与奖励相关动态的关注。实验表明,DyMoDreamer在Atari 100100k基准上以156.6%156.6\%的平均人类标准化得分创下新的state-of-the-art,在DeepMind Visual Control Suite上以832832创下新纪录,并在Crafter基准上经过11M步后获得9.5%9.5\%的性能提升。我们的代码已在 https://github.com/Ultraman-Tiga1/DyMoDreamer 发布。

关键词

引用

@article{arxiv.2509.24804,
  title  = {DyMoDreamer: World Modeling with Dynamic Modulation},
  author = {Boxuan Zhang and Runqing Wang and Wei Xiao and Weipu Zhang and Jian Sun and Gao Huang and Jie Chen and Gang Wang},
  journal= {arXiv preprint arXiv:2509.24804},
  year   = {2025}
}