中文

PO-GUISE+:基于姿态和对象引导的变换器标记选择用于高效驾驶员动作识别

计算机视觉与模式识别 2026-03-03 v2

摘要

我们聚焦于通过分析车内视频来识别分心驾驶行为,采用高效变换器方法。尽管变换器模型在人类动作识别任务中取得了卓越的性能,但其高计算成本限制了其在车载设备上的应用。我们引入 POGUISE+,一个多任务视频变换器模型,该模型在给定输入剪辑后,预测分心驾驶动作、驾驶员的姿态以及交互对象。我们专为驾驶员动作增强了标记选择特征,利用关于对象交互和驾驶员姿态的信息。通过 POGUISE+,我们显著降低了模型的计算需求,同时在各种计算预算下保持或提高基线准确率。此外,为评估模型在现实场景中的性能,我们开发了针对 Jetson 计算平台的基准测试,展示了其在不同配置和计算预算下的有效性。我们的模型在 Drive&Act、100-Driver 和 3MDAD 数据集上超越当前最先进的结果,同时在现有基于视频变换器的方法中具有优越的效率。

关键词

引用

@article{arxiv.2407.13750,
  title  = {PO-GUISE+: Pose and object guided transformer token selection for efficient driver action recognition},
  author = {Ricardo Pizarro and Roberto Valle and Rafael Barea and Jose M. Buenaposada and Luis Baumela and Luis Miguel Bergasa},
  journal= {arXiv preprint arXiv:2407.13750},
  year   = {2026}
}