中文

SGAP-Gaze:基于场景网格注意力的驾驶员注视点估计网络

计算机视觉与模式识别 2026-04-23 v1

摘要

驾驶员注视估计对于理解驾驶员对周围交通状况的态势感知至关重要。现有的注视估计模型使用驾驶员面部信息来预测注视点或三维注视方向向量。我们提出了一个基准数据集——城市驾驶-人脸场景注视数据集(UD-FSG),包含同步的驾驶员人脸和交通场景图像。场景图像提供了关于周围交通的线索,与面部图像一起有助于改进注视估计模型。我们提出了 SGAP-Gaze,一种基于场景网格注意力的注视点估计网络,该网络在我们的 UD-FSG 数据集上进行了训练和测试,明确地将场景图像纳入注视估计建模中。该注视估计网络整合了驾驶员面部、眼睛、虹膜和场景上下文信息。首先,将来自面部模态的提取特征融合以形成注视意图向量。然后,使用基于 Transformer 的注意力机制在空间场景网格上计算注意力分数,融合面部和场景图像特征以获得注视点。所提出的 SGAP-Gaze 模型在 UD-FSG 数据集上实现了 104.73 的平均像素误差,在 LBW 数据集上实现了 63.48 的平均像素误差,与最先进的驾驶员注视估计模型相比,平均像素误差降低了 23.5%。空间像素分布分析表明,SGAP-Gaze 在所有空间范围内(包括场景中罕见但对理解驾驶员注意力至关重要的外部区域)始终取得比现有方法更低的平均像素误差。这些结果突显了在真实驾驶环境中,将多模态注视线索与场景感知注意力相结合对于构建鲁棒的驾驶员注视点估计模型的有效性。

关键词

引用

@article{arxiv.2604.19888,
  title  = {SGAP-Gaze: Scene Grid Attention Based Point-of-Gaze Estimation Network for Driver Gaze},
  author = {Pavan Kumar Sharma and Pranamesh Chakraborty},
  journal= {arXiv preprint arXiv:2604.19888},
  year   = {2026}
}