中文

面向智能车辆的凝视基义义目标识别的跨范式评估

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

理解驾驶员在驾驶时注意力指向,作为凝视行为特征,对于开发下一代高级车辆辅助系统和改善道路安全至关重要。本文将此挑战作为从车辆前视摄像头捕获的路段场景中进行语义目标识别的任务来解决。具体而言,研究凝视点与对象语义的共现关系,使用三种不同的基于视觉的方法:直接目标检测(YOLOv13)、分段辅助分类(SAM2 搭配 EfficientNetV2 对比 YOLOv13)以及查询式视觉语言模型(VLM)(Qwen2.5-VL-7b 对比 Qwen2.5-VL-32b)。结果表明,直接目标检测(YOLOv13)和 Qwen2.5-VL-32b 显著优于其他方法,实现 Macro F1-Scores 超过 0.84。大型 VLM(Qwen2.5-VL-32b)尤其在识别小型安全关键目标(如交通灯),尤其在恶劣夜间条件下表现出更好的鲁棒性和性能。相比之下,分段辅助范式因存在“部件对整体”语义鸿沟,召回率表现大幅下降。结果揭示了传统检测器实时效率与大型 VLM 提供的更丰富上下文理解和鲁棒性之间的根本性权衡。这些发现为设计未来人类感知的智能驾驶监控系统提供了关键见解和实用指导。

关键词

引用

@article{arxiv.2602.01452,
  title  = {Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles},
  author = {Penghao Deng and Jidong J. Yang and Jiachen Bian},
  journal= {arXiv preprint arXiv:2602.01452},
  year   = {2026}
}

备注

21 pages, 15 figures, 3 tables