构建面向自动驾驶的视觉基础模型:挑战、方法与机遇
计算机视觉与模式识别
2024-01-17 v1
摘要
在大规模数据集上训练的大型基础模型的兴起正在彻底改变人工智能领域。SAM、DALL-E2 和 GPT-4 等模型展示了其适应性,能够提取复杂模式并在多样化任务中有效运行,从而成为各种 AI 应用的强大构建模块。自动驾驶作为 AI 应用的一个活跃前沿,仍然缺乏专用的视觉基础模型 (VFM)。全面的训练数据稀缺、多传感器集成的需求以及多样化的特定任务架构,构成了该领域 VFM 开发的重大障碍。本文深入探讨了构建专门针对自动驾驶的 VFM 这一关键挑战,同时也概述了未来方向。通过对 250 多篇论文的系统分析,我们剖析了 VFM 开发的关键技术,包括数据准备、预训练策略和下游任务适配。此外,我们探索了 NeRF、扩散模型、3D 高斯泼溅 (3D Gaussian Splatting) 和世界模型等关键进展,为未来研究呈现了一份全面的路线图。为了赋能研究人员,我们建立并维护了 https://github.com/zhanghm1995/Forge_VFM4AD,这是一个不断更新的开放访问仓库,收录了构建面向自动驾驶 VFM 的最新进展。
引用
@article{arxiv.2401.08045,
title = {Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities},
author = {Xu Yan and Haiming Zhang and Yingjie Cai and Jingming Guo and Weichao Qiu and Bin Gao and Kaiqiang Zhou and Yue Zhao and Huan Jin and Jiantao Gao and Zhen Li and Lihui Jiang and Wei Zhang and Hongbo Zhang and Dengxin Dai and Bingbing Liu},
journal= {arXiv preprint arXiv:2401.08045},
year = {2024}
}
备注
Github Repo: https://github.com/zhanghm1995/Forge_VFM4AD