Drive-JEPA:面向 end-to-end 驾驶的视频 JEPA 与多模态轨迹蒸馏
计算机视觉与模式识别
2026-01-30 v1
摘要
end-to-end 自动驾驶日益依赖自监督视频预训练以学习可迁移的规划表示。然而,为场景理解进行视频世界模型的预训练至今仅带来了有限的改进。这一限制又因驾驶的内在歧义所加重:每个场景通常仅提供单个人类轨迹,难以学习多模态行为。本文提出 Drive-JEPA 框架,将 Video Joint-Embedding Predictive Architecture(V-JEPA)与多模态轨迹蒸馏相集成,用于 end-to-end 驾驶。首先,我们为 end-to-end 驾驶调整 V-JEPA,在大规模驾驶视频上预训练 ViT 编码器,以产生与轨迹规划对齐的预测表示。其次,我们引入基于提案的规划器,对蒸馏来自模拟器生成的多样化轨迹以及人类轨迹进行处理,并采用动量感知选择机制以促进稳定和安全的行为。在 NAVSIM 上评估时,V-JEPA 表示结合简单的基于 transformer 的解码器在无感知设置下超越先前方法 3 PDMS。完整的 Drive-JEPA 框架在 v1 上的 V-JEPA 得分为 93.3 PDMS,在 v2 上的 EPDMS 为 87.8,达到新的 state-of-the-art。
引用
@article{arxiv.2601.22032,
title = {Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving},
author = {Linhan Wang and Zichong Yang and Chen Bai and Guoxiang Zhang and Xiaotong Liu and Xiaoyin Zheng and Xiao-Xiao Long and Chang-Tien Lu and Cheng Lu},
journal= {arXiv preprint arXiv:2601.22032},
year = {2026}
}