中文

Meta-DT:基于世界模型解耦的条件序列建模的离线元强化学习

机器学习 2024-10-25 v2

摘要

人工通用智能的一个长期目标是高度通用的通才,能够从多样化的经验中学习并泛化到未见过的任务。语言和视觉社区通过扩展基于 Transformer 的模型并在大规模数据集上训练,在这一趋势上取得了显著进展,而强化学习(RL)智能体在这种范式下仍然存在泛化能力差的问题。为了应对这一挑战,我们提出了元决策 Transformer(Meta-DT),它利用 Transformer 架构的序列建模能力和通过世界模型解耦的鲁棒任务表征学习,在离线元 RL 中实现高效泛化。我们预训练一个上下文感知的世界模型来学习紧凑的任务表征,并将其作为上下文条件注入因果 Transformer,以指导面向任务的序列生成。然后,我们巧妙地利用元策略生成的历史轨迹作为自引导提示,以利用架构的归纳偏置。我们选择在预训练世界模型上产生最大预测误差的轨迹片段来构建提示,旨在最大程度地编码与世界模型互补的任务特定信息。值得注意的是,所提出的框架在测试时消除了对任何专家演示或领域知识的需求。在 MuJoCo 和 Meta-World 基准测试中,跨各种数据集类型的实验结果表明,与强基线相比,Meta-DT 表现出优越的少样本和零样本泛化能力,同时更实用且先决条件更少。我们的代码可在 https://github.com/NJU-RL/Meta-DT 获取。

关键词

引用

@article{arxiv.2410.11448,
  title  = {Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement},
  author = {Zhi Wang and Li Zhang and Wenhao Wu and Yuanheng Zhu and Dongbin Zhao and Chunlin Chen},
  journal= {arXiv preprint arXiv:2410.11448},
  year   = {2024}
}

备注

NeurIPS 2024. TLDR: We leverage the sequential modeling ability of the transformer architecture and robust task representation learning via world model disentanglement to achieve efficient generalization in offline meta-RL