中文

Simulus:组合改进样本高效世界模型智能体

机器学习 2026-05-12 v4 人工智能

摘要

世界模型(WM)代表了样本高效强化学习的前沿,但其复杂性使得许多有前景的改进措施无法实现,因而需要显著的专业知识和努力来识别和集成它们。灵感来自 Rainbow,后者表明 DQN 个别已知改进措施彼此互补且可有效组合,我们承担了这一挑战并提出:相同的原理是否也适用于世界模型智能体。我们引入 Simulus,一个模块化基于标记的 WM 智能体,集成了:(1) 支持任意观察与动作模态组合的灵活标记化框架;(2) 用于认知不确定性减少的内在动机;(3) 优先级世界模型回放;以及 (4) 用于奖励和回报预测的回归即分类。Simulus 在三个多样化基准上实现了规划无 WM 的最先进样本高效性:视觉 Atari 100K、连续控制 DMC Proprioception 500K 以及符号 Craftax-1M。值得注意的是,尽管在样本高效 RL 的紧张交互预算下,内在动机仍有益,尽管其风险在于会在与任务无关的经验上浪费稀缺交互。消融研究表明,每个组件都各自作出贡献,其组合可实现协同增益。我们的代码和模型权重已公开可用,地址为 https://github.com/leor-c/Simulus。

关键词

引用

@article{arxiv.2502.11537,
  title  = {Simulus: Combining Improvements in Sample-Efficient World Model Agents},
  author = {Lior Cohen and Kaixin Wang and Bingyi Kang and Uri Gadot and Shie Mannor},
  journal= {arXiv preprint arXiv:2502.11537},
  year   = {2026}
}

备注

Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature