中文

提示线索:增强自动驾驶中多模态大语言模型的视觉表征

计算机视觉与模式识别 2025-10-16 v2

摘要

鉴于自动驾驶环境的动态性和严格的安全要求,结合CLIP的通用多模态大语言模型(MLLM)通常难以准确表示驾驶特定场景,尤其是在复杂交互和长尾情况下。为了解决这个问题,我们提出了提示线索(HoP)框架,该框架引入了三个关键增强:亲和力线索,通过强调实例级连接来增强实例级结构;语义线索,整合与驾驶相关的高级信息,例如车辆和交通标志之间的复杂交互;以及问题线索,将视觉特征与查询问题对齐,聚焦于与问题相关的区域。这些线索通过一个线索融合模块进行融合,利用有限的领域数据丰富驾驶相关表征,确保更快地适应驾驶场景。大量实验证实了HoP框架的有效性,表明它在所有关键指标上均显著优于先前的最先进方法。

关键词

引用

@article{arxiv.2411.13076,
  title  = {Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving},
  author = {Hao Zhou and Zhanning Gao and Zhili Chen and Maosheng Ye and Qifeng Chen and Tongyi Cao and Honggang Qi},
  journal= {arXiv preprint arXiv:2411.13076},
  year   = {2025}
}