中文

一个模型适用于所有任务:利用高效世界模型进行多任务规划

机器学习 2026-03-09 v3

摘要

在异构多任务决策中,任务不仅表现出多样化的观测和动作空间,其底层复杂性也存在显著差异。尽管像UniZero这样的传统多任务世界模型在单任务设置中表现优异,但我们发现当处理广泛且多样化的任务套件时,梯度冲突和模型可塑性的丧失往往会限制其样本效率。本工作从两个互补的视角解决这些挑战:单次学习迭代和整体学习过程。首先,为缓解梯度冲突,我们系统地研究了扩展UniZero的关键架构设计。我们的研究确定混合专家(Mixture-of-Experts, MoE)架构为最有效的方法。我们通过理论和实证均证明,该架构通过将任务特定表示路由到专用子网络来缓解梯度冲突。这一发现引出了我们所提出的模型ScaleZero。其次,为在整个学习过程中动态分配模型容量,我们引入了一种在线动态参数缩放(Dynamic Parameter Scaling, DPS)策略。该策略根据任务特定进展逐步集成LoRA适配器,实现自适应知识保留与参数扩展。在一组标准基准(Atari、DMC、Jericho)上的评估表明,ScaleZero仅利用在线强化学习与一个模型即可达到与专用单任务代理相当的性能。借助DPS策略,它仅需71.5%的环境交互即可保持竞争力。这些发现凸显了ScaleZero在有效多任务规划方面的潜力。我们的代码可在\textcolor{magenta}{https://github.com/opendilab/LightZero}获取。

关键词

引用

@article{arxiv.2509.07945,
  title  = {One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning},
  author = {Yuan Pu and Yazhe Niu and Jia Tang and Junyu Xiong and Shuai Hu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2509.07945},
  year   = {2026}
}

备注

55 pages, 20 figures. Accepted as a conference paper at ICLR 2026