中文

TS-VLM:面向多视角驾驶推理的基于文本引导软排序池化的视觉语言模型

计算机视觉与模式识别 2025-05-20 v1

摘要

视觉语言模型(VLM)通过多模态融合在提升自动驾驶场景感知、推理和决策方面展现出巨大的潜力。尽管如此,现有模型因计算开销大和高效整合多视角传感器数据不足,难以在安全关键的自动驾驶应用中实现实时部署。为此,本文设计了一种轻量级VLM——TS-VLM,集成了 novel 文本引导软排序池化(TGSSP)模块。通过利用输入查询的语义信息,TGSSP 对多个视角的视觉特征进行排序和融合,实现无需依赖高计算注意力机制的动态查询感知式多视角聚合。该设计确保语义相关视角的查询自适应优先级,从而提升自动驾驶中多视角推理的上下文准确性。在 DriveLM 数据集上的大规模评估表明,TS-VLM 在 BLEU-4 为 56.82、METEOR 为 41.91、ROUGE-L 为 74.64、CIDEr 为 3.39 等指标上超越最新模型。同时,TS-VLM 将计算成本降低最高可达 90%,最小版本仅包含 2010 万参数,更适用于实际自动驾驶车辆的实时部署。

关键词

引用

@article{arxiv.2505.12670,
  title  = {TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning},
  author = {Lihong Chen and Hossein Hassani and Soodeh Nikan},
  journal= {arXiv preprint arXiv:2505.12670},
  year   = {2025}
}