基于外观的视线估计结合合成图像与深度神经网络的增强方法
计算机视觉与模式识别
2024-03-01 v2 人工智能
摘要
人眼视线估计是成功实现人机交互的重要认知要素,使机器人能够读取并预测人类行为。我们使用人工神经网络处理此问题,构建了一个从分别裁剪的眼睛估计视线的模块化系统,利用了现有运行良好的人脸检测(RetinaFace)与头部姿态估计(6DRepNet)组件。我们提出的方法不需要任何特殊硬件或红外滤光片,而是使用标准笔记本内置 RGB 摄像头,这常与基于外观的方法一致。使用 MetaHuman 工具,我们还生成了超过 57,000 张人脸的大规模合成数据集并公开可用。将该数据集(含视线与头部姿态信息)在标准 Columbia Gaze 数据集之外加入模型训练,带来了更好的精度,眼睛俯仰与偏航方向平均误差低于两度,优于相关方法。我们还在真实场景中通过使用 NICO 半人形机器人眼睛内置的 4K 摄像头对模型进行初步测试,验证了模型的可行性。
引用
@article{arxiv.2311.14175,
title = {Appearance-based gaze estimation enhanced with synthetic images using deep neural networks},
author = {Dmytro Herashchenko and Igor Farkaš},
journal= {arXiv preprint arXiv:2311.14175},
year = {2024}
}
备注
6 pages, 10 figures, accepted to 2023 IEEE Symposium Series on Computational Intelligence (SSCI). Published version copyrighted by IEEE. This work was funded by the Horizon Europe Twinning project TERAIS G.A. number 101079338, and in part by the national project APVV-21-0105. The link to the code: https://zenodo.org/doi/10.5281/zenodo.10696083