中文

HiLM-D:以多尺度高分辨率细节增强多模态大语言模型用于自动驾驶

计算机视觉与模式识别 2025-03-25 v2

摘要

近期利用自然语言实现可解释驾驶的研究主要聚焦于规划,忽视了感知任务。本文通过引入 ROLISP(风险物体定位与意图及建议预测)弥补此不足,其面向本车运动的可解释风险物体检测与建议。准确的 ROLISP 实现需要大量推理以识别关键交通物体并推断其意图,促使我们探索多模态大语言模型(MLLMs)的能力。然而,现有 MLLM 中 CLIP-ViT 视觉编码器的有限感知性能难以捕捉自动驾驶所需的关键视觉感知信息,例如高分辨率、多尺度及视觉相关的归纳偏置。为应对这些挑战,我们提出 HiLM-D,一种资源高效的框架,用于增强 MLLM 在 ROLISP 中的视觉信息处理。我们的方法基于如下事实:自动驾驶场景中的主要变化是运动轨迹而非物体的语义或外观信息(如形状与颜色)。因此,HiLM-D 的视觉处理为双流框架:(i)时序推理流,接收低分辨率动态视频内容以捕捉时序语义;(ii)空间感知流,接收单张高分辨率帧以捕捉整体视觉感知相关信息。空间感知流可通过精心设计的 P-Adapter 变得非常轻量,其轻量、训练高效且易于集成至现有 MLLM。在 DRAMA-ROLISP 数据集上的实验表明,HiLM-D 相较当前 MLLM 有显著提升,描述任务 BLEU-4 提升 3.7%,检测任务 mIoU 提升 8.7%。

关键词

引用

@article{arxiv.2309.05186,
  title  = {HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving},
  author = {Xinpeng Ding and Jianhua Han and Hang Xu and Wei Zhang and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2309.05186},
  year   = {2025}
}

备注

Accepted by IJCV