车内视线:面向车内视线估计的综合视觉解决方案
计算机视觉与模式识别
2024-03-26 v1
摘要
驾驶员的眼动视线蕴含着对智能车辆至关重要的丰富认知与意图线索。尽管其意义重大,但由于真实驾驶场景中缺乏全面且标注良好的数据集,车内视线估计的研究仍然有限。本文提出了三个新颖要素以推进车内视线研究。首先,我们引入了 IVGaze,这是一个开创性的数据集,采集了 125 名受试者的车内视线,覆盖了车内大范围的视线和头部姿态。传统的视线采集系统不适用于车内环境。在该数据集中,我们提出了一种基于视觉的新型车内视线采集方案,并引入了一种精细化的视线目标标定方法以应对标注挑战。其次,我们的研究重点是利用 IVGaze 进行车内视线估计。车内人脸图像通常分辨率较低,这促使我们引入了视线金字塔变换器(gaze pyramid transformer),它利用基于变换器的多层次特征融合。在此基础上,我们进一步提出了双流视线金字塔变换器(GazeDPTR)。通过透视变换,我们旋转虚拟相机以归一化图像,并利用相机姿态融合归一化图像和原始图像,以实现精确的视线估计。GazeDPTR 在 IVGaze 数据集上展现了最先进的性能。第三,我们通过扩展 GazeDPTR,探索了一种新颖的视线区域分类策略。我们新定义了一个基础三平面,并将视线投影到这些平面上。通过同时利用投影点的位置特征和图像的视觉属性,我们取得了优于仅依赖视觉特征的性能,从而证实了视线估计的优势。我们的项目可在 https://yihua.zone/work/ivgaze 获取。
引用
@article{arxiv.2403.15664,
title = {What Do You See in Vehicle? Comprehensive Vision Solution for In-Vehicle Gaze Estimation},
author = {Yihua Cheng and Yaning Zhu and Zongji Wang and Hongquan Hao and Yongwei Liu and Shiqing Cheng and Xi Wang and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2403.15664},
year = {2024}
}
备注
CVPR24