中文

解缠结世界模型:从分散视频中学习传递语义知识用于强化学习

计算机视觉与模式识别 2026-04-07 v3 机器学习

摘要

在实际场景中训练视觉强化学习(RL) presents a significant challenge,即 RL 代理在具有变化的环境中 suffer from low sample efficiency。虽然各种方法试图通过解缠结表征学习来缓解此问题,但这些方法通常 lacks prior knowledge of the world 而从头开始学习。本文则尝试通过离线到在线的潜在蒸馏和灵活的解缠结约束,从分散视频中学习和理解潜在语义变化。为实现有效的跨域语义知识传递,我们引入一种可解释的基于模型的 RL 框架,称为解缠结世界模型(DisWM)。具体而言,我们在带有解缠结正则化的离线条件下预训练无动作视频预测模型,以从分散视频中提取语义知识。然后通过潜在蒸馏将预训练模型的解缠结能力传递到世界模型中。对于在线环境中的微调,我们利用来自预训练模型的知识,并在世界模型中引入解缠结约束。在适应阶段,纳入来自在线环境交互的动作和奖励,丰富了数据的多样性,从而加强了解缠结表征学习。实验结果在 various benchmarks 上验证了我们方法的优越性。

关键词

引用

@article{arxiv.2503.08751,
  title  = {Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement Learning},
  author = {Qi Wang and Zhipeng Zhang and Baao Xie and Xin Jin and Yunbo Wang and Shiyu Wang and Liaomo Zheng and Xiaokang Yang and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2503.08751},
  year   = {2026}
}

备注

Accepted by ICCV 2025. Project page: https://qiwang067.github.io/diswm