GenAD:面向自动驾驶的通用预测模型
计算机视觉与模式识别
2024-08-09 v2
摘要
本文介绍了第一个面向自动驾驶领域的大规模视频预测模型。为消除高成本数据收集的限制,并赋予模型更好的泛化能力,我们从网络上获取大量数据,并将其与多样且高质量的文本描述配对。最终构建的数据集累积了超过 2000 小时的驾驶视频,覆盖全球多个地区,涵盖多种天气条件和交通场景。继承最新潜力扩散模型的优势,GenAD 通过 novel temporal reasoning blocks 处理驾驶场景中的复杂动态。我们展示了它能够以零样本方式泛化到各种未见过的驾驶数据集,超越通用或驾驶特定的视频预测模型。此外,GenAD 可适配为基于动作的预测模型或运动规划器,具有广泛的实际应用潜力。
引用
@article{arxiv.2403.09630,
title = {GenAD: Generalized Predictive Model for Autonomous Driving},
author = {Jiazhi Yang and Shenyuan Gao and Yihang Qiu and Li Chen and Tianyu Li and Bo Dai and Kashyap Chitta and Penghao Wu and Jia Zeng and Ping Luo and Jun Zhang and Andreas Geiger and Yu Qiao and Hongyang Li},
journal= {arXiv preprint arXiv:2403.09630},
year = {2024}
}
备注
CVPR 2024 Highlight Paper. Dataset: https://github.com/OpenDriveLab/DriveAGI