中文

面向自动驾驶的高效视觉问答管线:基于场景区域压缩

计算机视觉与模式识别 2026-01-13 v1

摘要

自动驾驶日益依赖于视觉问答(VQA)以理解通过分析视觉输入和文本查询来掌握复杂环境。当前,VQA 在此领域的关键关切是对快速延迟和实时处理的严格要求,因为延迟直接影响此安全关键应用中的实际安全。然而,当前的状态化 VQA 模型,特别是大型视觉语言模型(VLM),往往侧重于性能而非计算效率。这些模型通常处理每个帧的所有稠密 patch token,导致计算成本(FLOPs)和显著推理延迟,尤其在长视频序列中尤为如此。这种关注限制了其在实时自动驾驶场景中的实际部署。为解决此问题,我们提出一种用于自动驾驶 VQA 任务的高效 VLM 框架,称为 SRC-Pipeline。它学习将早期帧的 token 压缩为少数高层次 token,同时保留最近几帧的完整 patch token。针对自动驾驶视频问答任务进行实验,表明该方法实现了 66% 的 FLOPs 降低,同时保持可比性能,使 VLM 能在更有效地应对实时、安全关键的自动驾驶环境中发挥作用。

关键词

引用

@article{arxiv.2601.07092,
  title  = {Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression},
  author = {Yuliang Cai and Dongqiangzi Ye and Zitian Chen and Chongruo Wu},
  journal= {arXiv preprint arXiv:2601.07092},
  year   = {2026}
}

备注

7 pages