中文

DynRsl-VLM:利用动态分辨率视觉语言模型增强自动驾驶感知

计算机视觉与模式识别 2025-03-17 v1

摘要

视觉问答(VQA)模型属于视觉语言模型范畴,通常对图像输入执行多次下采样过程,以在计算效率与模型性能之间取得平衡。尽管这种方法有助于聚焦显著特征并减轻计算负担,但它会导致重要细节信息的丢失,这一缺陷在端到端自动驾驶场景中尤为致命。下采样可能导致对行人、路标或障碍物等远处或小目标的捕获不足,而这些目标对安全导航至关重要。这种特征丢失会削弱自动驾驶系统准确感知环境的能力,可能增加事故风险。为解决这一问题,我们提出了动态分辨率视觉语言模型(DynRsl-VLM)。DynRsl-VLM 采用动态分辨率图像输入处理方法,在捕获图像内所有实体特征信息的同时,确保图像输入对 Vision Transformer (ViT) 保持计算上的可处理性。此外,我们设计了一个新颖的图像-文本对齐模块来替代 Q-Former,在处理动态分辨率图像输入时实现简单高效的文本对齐。我们的方法在不超出计算约束的前提下,增强了自动驾驶系统的环境感知能力。

关键词

引用

@article{arxiv.2503.11265,
  title  = {DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models},
  author = {Xirui Zhou and Lianlei Shan and Xiaolin Gui},
  journal= {arXiv preprint arXiv:2503.11265},
  year   = {2025}
}