面向自动驾驶的多模态大语言模型零样本场景理解
计算机视觉与模式识别
2025-06-17 v1 计算与语言
摘要
场景理解对于自动驾驶中的各种下游任务至关重要,包括促进驾驶员-代理通信以及增强自动驾驶车辆决策以人为中心的可解释性。本文评估了四种多模态大语言模型(包括相对较小的模型)在零样本、上下文学习设置中理解场景的能力。此外,我们探索了是否可以通过集成方法和多数投票结合这些模型来增强场景理解性能。我们的实验表明,最大的模型 GPT-4o 在场景理解方面优于其他模型。然而,GPT-4o 与较小模型之间的性能差距相对温和,这表明改进的上下文学习、检索增强生成(RAG)或微调等先进技术可以进一步优化较小模型的性能。我们还观察到集成方法的结果参差不齐:虽然某些场景属性在 F1 分数等性能指标上有所改善,但其他属性却出现了下降。这些发现强调了需要更复杂的集成技术,以在所有场景属性上实现一致的提升。本研究强调了利用多模态大语言模型进行场景理解的潜力,并为优化其在自动驾驶应用中的性能提供了见解。
引用
@article{arxiv.2506.12232,
title = {Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles},
author = {Mohammed Elhenawy and Shadi Jaradat and Taqwa I. Alhadidi and Huthaifa I. Ashqar and Ahmed Jaber and Andry Rakotonirainy and Mohammad Abu Tami},
journal= {arXiv preprint arXiv:2506.12232},
year = {2025}
}