基于视觉语言模型的路怒推理:任务定义与评估数据集
计算机视觉与模式识别
2025-03-17 v1
摘要
路怒症由交通拥堵和激进驾驶等驾驶相关刺激引发,对道路安全构成重大威胁。以往关于路怒症调控的研究主要集中于反应抑制,缺乏主动预防能力。随着视觉语言模型的问世,对触发事件进行视觉推理并在驾驶员愤怒升级前进行基于对话的安抚成为可能。为此,我们提出路怒推理任务,并附带一个精细标注的测试数据集和评估指标,以评估当前主流 VLM 在场景理解、事件识别和路怒推理方面的能力。结果表明,当前 VLM 在视觉模态的场景理解以及文本模态中物体间空间关系的理解上均存在显著不足。提升 VLM 在这些领域的性能将极大地有益于前因聚焦的路怒调控等下游任务。
引用
@article{arxiv.2503.11342,
title = {Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset},
author = {Yibing Weng and Yu Gu and Fuji Ren},
journal= {arXiv preprint arXiv:2503.11342},
year = {2025}
}