混合世界模型:模块化潜在动力学下的多任务强化学习扩展
机器学习
2026-02-03 v1
摘要
多任务强化学习 (MTRL) 的核心挑战之一是在视觉域中实现样本效率,因为该域中存在大量观测和动力学方面的异质性。基于模型的强化学习通过世界模型提供了提升样本效率的可行路径,但标准的单一体系结构难以捕捉多样化的任务动力学,导致重建和预测精度较差。我们引入混合世界模型 (Mixture-of-World Models, MoW),这是一种可扩展的体系结构,结合了用于任务自适应视觉压缩的模块化变分自编码器、具有任务条件专家和共享主干网络的混合 Transformer 动力学模型,以及用于高效参数分配的基于梯度的任务聚类策略。在 Atari 100k 基准上,单个 MoW 智能体仅训练一次即可在 26 个 Atari 游戏上获得平均人类标准化得分 110.4%,与由 26 个任务特定模型组成的 STORM 获得的 114.2%得分相当,同时使用 50% 更少的参数。在 Meta-World 上,MoW 在 30 万环境步数内实现了 74.5% 的平均成功率,建立了新的最佳状态。这些结果表明,MoW 为通用世界模型提供了一个可扩展且参数高效的基础。
关键词
引用
@article{arxiv.2602.01270,
title = {Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics},
author = {Boxuan Zhang and Weipu Zhang and Zhaohan Feng and Wei Xiao and Jian Sun and Jie Chen and Gang Wang},
journal= {arXiv preprint arXiv:2602.01270},
year = {2026}
}