基于卷积神经网络的驾驶员注视区域估计:通用框架与消融分析
计算机视觉与模式识别
2018-04-26 v2
摘要
在智能车辆中,驾驶员注视已被证明是驾驶员注意力的极佳替代指标。随着高度自动驾驶车辆近期的激增,驾驶员注视可用于确定向人类驾驶员交接的时机。尽管个性化驾驶员注视区域估计系统已取得显著改进,但一个对不同受试者、视角和尺度均不变的通用系统仍然缺失。我们使用卷积神经网络(CNNs)向这一通用系统迈进。我们为此任务微调了4种流行的CNN架构,并对其输出进行了广泛比较。我们还尝试了不同的输入图像块,并考察了图像尺寸如何影响性能。为训练和测试网络,我们收集了一个大型自然驾驶数据集,包含10名受试者在两辆不同汽车中进行的11次长途驾驶。我们的最佳模型在跨受试者测试中达到了95.18%的准确率,优于当前该任务的最先进(SOTA)技术。最后,我们在公开可用的Columbia Gaze Dataset上评估了我们的最佳模型,该数据集包含56名具有不同头部姿态和注视方向的受试者图像。无需任何训练,我们的模型便在此多样化数据集上成功编码了不同的注视方向,展示了良好的泛化能力。
引用
@article{arxiv.1802.02690,
title = {Driver Gaze Zone Estimation using Convolutional Neural Networks: A General Framework and Ablative Analysis},
author = {Sourabh Vora and Akshay Rangesh and Mohan M. Trivedi},
journal= {arXiv preprint arXiv:1802.02690},
year = {2018}
}