中文

DriveBLIP2:用于复杂驾驶情景的注意力引导解释生成

机器人学 2025-07-01 v1 计算机视觉与模式识别 机器学习

摘要

本文提出了全新的框架 DriveBLIP2,基于 BLIP2-OPT 架构,用于生成准确且情境相关的解释,以解释出现的驾驶情景。虽然现有的视觉语言模型在通用任务上表现良好,但在理解复杂、多目标环境时存在困难,尤其是在实时应用场景如自动驾驶中,快速识别关键对象至关重要。为此,本文提出注意力图生成器,用于在关键视频帧中突出显示与驾驶决策相关的重要对象。通过将模型注意力引导至这些关键区域,生成的注意力图有助于产生清晰且相关的解释,使驾驶员更好地理解车辆在紧急情况下的决策过程。在 DRAMA 数据集上的评估结果表明,与基线模型相比,解释质量显著提升,BLEU、ROUGE、CIDEr 和 SPICE 指标均取得显著提升。这些发现凸显了在视觉语言模型中应用针对性注意力机制以提升实时自动驾驶中可解释性的潜力。

关键词

引用

@article{arxiv.2506.22494,
  title  = {DriveBLIP2: Attention-Guided Explanation Generation for Complex Driving Scenarios},
  author = {Shihong Ling and Yue Wan and Xiaowei Jia and Na Du},
  journal= {arXiv preprint arXiv:2506.22494},
  year   = {2025}
}

备注

Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. 7 pages, 3 figures