中文

注视信息引导的视觉Transformer:不确定性下的驾驶决策预测

计算机视觉与模式识别 2025-01-13 v2 人工智能 机器学习

摘要

视觉Transformer(ViT)已推动了计算机视觉的发展,但其在驾驶等复杂任务中的有效性仍较少被探索。本研究通过整合经眼动追踪采集的人眼注视信息来增强ViT,以提升其在真实世界与虚拟现实场景中不确定性驾驶情境下的预测准确率。首先,我们在人类被试与ViT模型中均确立了人眼注视在左右驾驶决策中的重要性。通过比较人类注视图与ViT注意力权重的相似性,我们揭示了跨个体注意力头与层的重叠动态。该重叠表明注视数据可引导模型更有效地分配其注意力权重。我们提出注视-注意力交集(FAX)损失,一种显著提升高不确定性条件下ViT性能的新损失函数。结果表明,经FAX损失训练的ViT可使其注意力与人类注视模式对齐。这种注视信息引导的方法在驾驶员行为分析以及以人为中心AI系统的更广泛应用方面具有显著潜力,将ViT的使用拓展至复杂视觉环境。

关键词

引用

@article{arxiv.2308.13969,
  title  = {Gaze-Informed Vision Transformers: Predicting Driving Decisions Under Uncertainty},
  author = {Sharath Koorathota and Nikolas Papadopoulos and Jia Li Ma and Shruti Kumar and Xiaoxiao Sun and Arunesh Mittal and Patrick Adelman and Paul Sajda},
  journal= {arXiv preprint arXiv:2308.13969},
  year   = {2025}
}

备注

25 pages, 9 figures, 3 tables