中文

面向自动驾驶感知的基础模型:基于核心能力的综述

机器人学 2025-09-11 v1 计算机视觉与模式识别

摘要

基础模型正在 revolutionizing 自动驾驶感知领域,使该领域从以窄化、任务特定的深度学习模型过渡到具有多样性、通用性强的架构,这些架构是在大规模、多样化数据集上训练的。本综述考察了这些模型如何解决自动感知中的关键挑战,包括泛化性、可扩展性以及对分布迁移的鲁棒性不足的问题。本综述引入了一种新颖的分类框架,围绕四项基本能力构建:广义知识、空间理解、多传感器鲁棒性和时序推理。对于每一项能力,本综述阐明了其重要性,并全面回顾了最新方法。与传统以方法为中心的综述不同,本文的独特框架优先考虑概念设计原则,为模型开发提供基于能力的指导,并为理解基础层面提供更清晰的见解。我们在讨论关键挑战时,特别关注将这些能力集成到实时、可扩展系统中的挑战,以及计算需求和确保模型可靠性(如幻觉和超出分布失效)方面的更广泛部署挑战。本综述还概述了关键的未来研究方向,以促进基础模型在自动驾驶系统中安全、有效的部署。

关键词

引用

@article{arxiv.2509.08302,
  title  = {Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities},
  author = {Rajendramayavan Sathyam and Yueqi Li},
  journal= {arXiv preprint arXiv:2509.08302},
  year   = {2025}
}

备注

32 pages, 14 figures, accepted at IEEE Open Journal of Vehicular Technology (OJVT)