RoboTron-Drive:面向自动驾驶的一体化大型多模态模型
计算机视觉与模式识别
2025-08-08 v5 多媒体
机器人学
摘要
大型多模态模型(LMMs)通过融合大型语言模型,在自动驾驶(AD)中展现出卓越的理解与解释能力。尽管取得了这些进展,当前数据驱动的自动驾驶方法往往集中于单一数据集和特定任务,忽视了其整体能力与泛化能力。为弥合这些差距,我们提出 RoboTron-Drive,一个通用的大型多模态模型,旨在处理图像和多视角视频等多种数据输入,同时执行包括感知、预测和规划在内的广泛自动驾驶任务。首先,该模型通过课程式预训练处理多样的视觉信号,并执行基本的视觉理解与感知任务。随后,我们增强并标准化了多个自动驾驶数据集,对模型进行微调,从而得到一个面向自动驾驶的一体化 LMM。为评估其通用能力与泛化能力,我们在六个公开基准上进行了评测,并在三个未见过的数据集上进行了零样本迁移,RoboTron-Drive 在所有任务上均取得了最先进的性能。我们希望 RoboTron-Drive 能成为现实世界中自动驾驶的一个有前景的解决方案。项目页面及代码:https://github.com/zhijian11/RoboTron-Drive。
引用
@article{arxiv.2412.07689,
title = {RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving},
author = {Zhijian Huang and Chengjian Feng and Feng Yan and Baihui Xiao and Zequn Jie and Yujie Zhong and Xiaodan Liang and Lin Ma},
journal= {arXiv preprint arXiv:2412.07689},
year = {2025}
}
备注
ICCV 2025