Speak2Label:利用领域知识创建大规模驾驶员注视区域估计数据集
计算机视觉与模式识别
2021-10-19 v4
摘要
人类行为分析数据的标注是一项复杂且耗时的任务。本文提出一种全自动技术,用于标注基于图像的驾驶员注视区域估计行为数据集。领域知识被加入数据记录范式,随后利用语音转文本转换 (STT) 自动生成标签。为消除 STT 过程中因数据中受试者光照与种族差异带来的噪声,我们对语音频率与能量进行了分析。所得的 Driver Gaze in the Wild (DGW) 数据集包含 586 段记录,采集于一天中包括傍晚在内的不同时段。该大规模数据集包含 338 名受试者,年龄范围为 18-63 岁。由于数据在不同光照条件下采集,我们在卷积神经网络 (CNN) 中提出了一种光照鲁棒层。大量实验显示了数据集 resembling 真实世界条件的方差以及所提 CNN 流程的有效性。所提网络也为眼动注视预测任务进行了微调,显示出我们的网络在所提 DGW 数据集上学到的表示的判别性。项目主页:https://sites.google.com/view/drivergazeprediction/home
引用
@article{arxiv.2004.05973,
title = {Speak2Label: Using Domain Knowledge for Creating a Large Scale Driver Gaze Zone Estimation Dataset},
author = {Shreya Ghosh and Abhinav Dhall and Garima Sharma and Sarthak Gupta and Nicu Sebe},
journal= {arXiv preprint arXiv:2004.05973},
year = {2021}
}