中文

基于自适应世界模型的规划:AdaWM 用于自动驾驶

机器人学 2025-01-24 v2 人工智能

摘要

基于世界模型的强化学习(RL)已成为自动驾驶的有前景的方法,它学习潜在动态模型并用于训练规划策略。为加快学习过程,常采用预训练-微调范式,即使用预训练模型初始化在线 RL,并离线学习策略。然而, naively 执行此类初始化在 RL 中可能导致在新任务的在线交互期间出现显著的性能下降。为解决此挑战,我们首先分析性能下降的原因,确定两个主要根源:规划策略的不匹配以及动态模型的不匹配,由于分布迁移。我们进一步分析了这些因素对微调期间性能下降的影响,我们的发现表明,微调策略的选择在缓解这些影响方面起着关键作用。我们随后引入 AdaWM,即基于自适应世界模型的规划方法,具有两个关键步骤:(a)不匹配识别,定量衡量不匹配情况并为微调策略提供指导;(b)基于对齐的微调,通过高效低秩更新有选择地更新策略或模型。在具有挑战性的 CARLA 驾驶任务上的大量实验表明,AdaWM 显著改进了微调过程,在自动驾驶系统中实现了更稳健、更高效的性能。

关键词

引用

@article{arxiv.2501.13072,
  title  = {AdaWM: Adaptive World Model based Planning for Autonomous Driving},
  author = {Hang Wang and Xin Ye and Feng Tao and Chenbin Pan and Abhirup Mallik and Burhaneddin Yaman and Liu Ren and Junshan Zhang},
  journal= {arXiv preprint arXiv:2501.13072},
  year   = {2025}
}

备注

ICLR 2025