端到端自动驾驶中的零样本跨城市泛化:自监督 versus 监督表征
计算机视觉与模式识别
2026-03-13 v1 机器学习
摘要
端到端自动驾驶模型通常在多城市数据集上使用基于 ImageNet 预训练的监督式 backbone 进行训练,但其对未知城市的泛化能力仍未得到充分探讨。当训练和评估数据地理上混合时,模型可能隐式依赖于城市特定线索,掩盖了在实际域迁移下泛化到新位置时可能出现的失效模式。本文我们探讨端到端自动驾驶中的零样本跨城市泛化问题,询问自监督视觉表征是否改善跨城市的迁移。我们通过将自监督 backbone(I-JEPA、DINOv2 和 MAE)集成到规划框架中,进行全面研究。在严格的地理分割下,我们在nuScenes 上进行开放式评估,在 NAVSIM 上进行封闭式评估协议。我们的实验显示,当使用传统监督 backbone 在不同城市之间进行迁移时,存在显著的泛化差距,尤其是从右侧驾驶环境迁移到左侧驾驶环境时。自监督表征学习可减少这一差距。在开放式评估中,监督式 backbone 在从波士顿迁移到新加坡时表现严重膨胀(L2 位移比例 9.77 倍,碰撞比例 19.43 倍),而领域特定的自监督预训练将其降低到 1.20 倍和 0.75 倍。 在封闭式评估中,自监督预训练对所有单城市训练城市的 PDMS 提高了最高可达 4 个百分点。这些结果表明,表征学习对跨城市规划的鲁棒性具有强大的影响,确立了零样本地理转移是评估端到端自动驾驶系统必要的测试。
引用
@article{arxiv.2603.11417,
title = {Zero-Shot Cross-City Generalization in End-to-End Autonomous Driving: Self-Supervised versus Supervised Representations},
author = {Fatemeh Naeinian and Ali Hamza and Haoran Zhu and Anna Choromanska},
journal= {arXiv preprint arXiv:2603.11417},
year = {2026}
}