中文

基于瞳视力驱动的眼线 egocentric 视频理解框架用于检测驾驶员认知分心

计算机视觉与模式识别 2026-05-11 v1

摘要

驾驶员认知分心是道路碰撞的一个主要原因,仍然难以检测。与手动或视觉分心不同,认知分心是由与驾驶无关的思维所占据,即使驾驶员看起来在视觉上注意力集中且没有明显的身体动作。本文提出了 EyeCue,一个瞳视力驱动的 egocentric 视频理解框架,用于检测驾驶员认知分心。我们的关键洞察是,认知分心在瞳视力与视觉背景的交互中显现。为捕捉这种交互,EyeCue 将瞳视力与 egocentric 视频集成,以实现对驾驶员注意力随时间变化的情境感知建模。此外,为解决现有数据集规模和多样性有限的问题,我们引入了 CogDrive,一个覆盖多场景的综合数据集,将认知分心注释添加到四个现有驾驶数据集中。通过在 CogDrive 上进行广泛评估,我们表明 EyeCue 在准确率上达到了 74.38%,超过 6 个模型家族中 11 个基线方法超过 7%。值得注意的是,EyeCue 在各种驾驶场景(不同道路类型、不同时间段和不同天气条件)下都能实现超过 70% 的准确率,并表现出强大的泛化能力。这些结果凸显了对瞳视力-背景交互建模的重要性以及跨模态交互建模对于多模态认知分心检测的有效性。我们的代码和 CogDrive 数据集资源已在 https://github.com/langzhang2000/EyeCue 上提供。

关键词

引用

@article{arxiv.2605.07859,
  title  = {EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding},
  author = {Lang Zhang and JinYi Yoon and Matthew Corbett and Abhijit Sarkar and Bo Ji},
  journal= {arXiv preprint arXiv:2605.07859},
  year   = {2026}
}

备注

Accepted to the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)