中文

WPT:基于在线世界模型蒸馏的世界到策略迁移

计算机视觉与模式识别 2026-03-19 v2

摘要

近年来,世界模型取得了显著进展,主要旨在捕捉智能体动作与不断演变环境之间的时空关联。然而,现有方法常受限于运行时耦合或依赖离线奖励信号,导致推理开销大或阻碍端到端优化。为克服这些限制,我们引入WPT(World-to-Policy Transfer)训练范式,实现在端到端世界模型指导下进行在线蒸馏。具体而言,我们开发可训练的奖励模型,通过将候选轨迹与世界模型预测的未来动态对齐,将世界知识注入教师策略。随后,我们提出策略蒸馏和世界奖励蒸馏,将教师的推理能力转移到轻量级学生策略中,在保持实时部署可行性的同时提升规划性能。广泛的开环和闭环基准实验表明,WPT在简单策略架构下实现了最先进的性能:开环 collision rate 为0.11%,闭环 driving score 达79.23分,超越世界模型和模仿学习方法在准确性和安全性方面的表现。此外,学生可实现最高4.9倍的推理加速,同时保留大部分收益。

关键词

引用

@article{arxiv.2511.20095,
  title  = {WPT: World-to-Policy Transfer via Online World Model Distillation},
  author = {Guangfeng Jiang and Yueru Luo and Jun Liu and Yi Huang and Yiyao Zhu and Zhan Qu and Dave Zhenyu Chen and Bingbing Liu and Xu Yan},
  journal= {arXiv preprint arXiv:2511.20095},
  year   = {2026}
}

备注

CVPR2026 Accepted