中文

何处、何物、为何:迈向可解释的驾驶员注意力预测

计算机视觉与模式识别 2025-07-01 v1

摘要

在驾驶中对任务驱动的注意力进行建模是自动驾驶车辆和认知科学的一项基本挑战。现有方法主要通过生成空间热力图来预测驾驶员的视线落点,但未能捕捉在特定情境下注意力分配背后的认知动机,这限制了对注意力机制的深入理解。为弥补这一不足,我们引入了可解释的驾驶员注意力预测,这是一种新颖的任务范式,能够联合预测空间注意力区域(何处)、解析所关注的语义(何物),并为注意力分配提供认知推理(为何)。为此,我们提出了 W3DA,这是首个大规模可解释驾驶员注意力数据集。它在现有基准上丰富了跨越多种驾驶场景(包括正常条件、安全关键情况和交通事故)的详细语义与因果标注。我们进一步提出了 LLada,一个由大语言模型驱动的驾驶员注意力预测框架,它在端到端架构内统一了像素建模、语义解析和认知推理。大量实验证明了 LLada 的有效性,展现出跨数据集和驾驶条件的稳健泛化能力。这项工作是迈向深入理解驾驶员注意力机制的关键一步,对自动驾驶、智能驾驶员培训和人机交互具有重要意义。

关键词

引用

@article{arxiv.2506.23088,
  title  = {Where, What, Why: Towards Explainable Driver Attention Prediction},
  author = {Yuchen Zhou and Jiayu Tang and Xiaoyan Xiao and Yueyao Lin and Linkai Liu and Zipeng Guo and Hao Fei and Xiaobo Xia and Chao Gou},
  journal= {arXiv preprint arXiv:2506.23088},
  year   = {2025}
}

备注

Accepted by ICCV 2025