DriVLM: 自动驾驶中视觉语言模型的领域自适应
机器学习
2025-01-10 v1
摘要
近年来,大型语言模型表现出非常令人印象深刻的性能,极大地促进了人工智能的发展和应用,并且模型的参数和性能仍在快速增长。特别是,多模态大型语言模型(MLLM)可以结合图片、视频、声音、文本等多种模态,在各种任务中具有巨大潜力。然而,大多数MLLM需要非常高的计算资源,这对大多数研究人员和开发者来说是一个重大挑战。在本文中,我们探索了小规模MLLM的实用性,并将小规模MLLM应用于自动驾驶领域。我们希望这将推动MLLM在实际场景中的应用。
引用
@article{arxiv.2501.05081,
title = {DriVLM: Domain Adaptation of Vision-Language Models in Autonomous Driving},
author = {Xuran Zheng and Chang D. Yoo},
journal= {arXiv preprint arXiv:2501.05081},
year = {2025}
}