面向自动驾驶感知的基础模型:基于核心能力的综述
机器人学
2025-09-11 v1 计算机视觉与模式识别
摘要
基础模型正在 revolutionizing 自动驾驶感知领域,使该领域从以窄化、任务特定的深度学习模型过渡到具有多样性、通用性强的架构,这些架构是在大规模、多样化数据集上训练的。本综述考察了这些模型如何解决自动感知中的关键挑战,包括泛化性、可扩展性以及对分布迁移的鲁棒性不足的问题。本综述引入了一种新颖的分类框架,围绕四项基本能力构建:广义知识、空间理解、多传感器鲁棒性和时序推理。对于每一项能力,本综述阐明了其重要性,并全面回顾了最新方法。与传统以方法为中心的综述不同,本文的独特框架优先考虑概念设计原则,为模型开发提供基于能力的指导,并为理解基础层面提供更清晰的见解。我们在讨论关键挑战时,特别关注将这些能力集成到实时、可扩展系统中的挑战,以及计算需求和确保模型可靠性(如幻觉和超出分布失效)方面的更广泛部署挑战。本综述还概述了关键的未来研究方向,以促进基础模型在自动驾驶系统中安全、有效的部署。
引用
@article{arxiv.2509.08302,
title = {Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities},
author = {Rajendramayavan Sathyam and Yueqi Li},
journal= {arXiv preprint arXiv:2509.08302},
year = {2025}
}
备注
32 pages, 14 figures, accepted at IEEE Open Journal of Vehicular Technology (OJVT)