轻量级眼动估计模型:通过融合全局信息
计算机视觉与模式识别
2026-03-24 v2
摘要
基于深度学习的外观眼动估计方法因其高精度和较少的环境约束而日益受到欢迎。然而,现有的高精度模型常依赖更深的网络,导致参数大、训练时间长、收敛慢等问题。针对此问题,本文提出一种新型轻量级眼动估计模型FGI-Net(Fusion Global Information)。该模型将全局信息融入CNN,有效弥补了多层卷积和池化间接捕获全局信息的需求,同时降低模型复杂度,提高模型精度和收敛速度。为验证模型性能,本文进行大量实验,比较了与现有经典模型和轻量级模型的精度、不同架构模型的收敛速度以及消融实验。实验结果表明,与最新的眼动估计模型GazeCaps相比,FGI-Net在参数和FLOPs分别减少87.1%和79.1%,在MPIIFaceGaze(3.74°)、EyeDiap(5.15°)、Gaze360(10.50°)和RT-Gene(6.02°)上实现更小的角度误差。此外,与CNN和Transformer等不同架构模型相比,FGI-Net能够在更少的训练迭代次数下快速收敛到更高的精度范围。在Gaze360和EyeDiap数据集上实现最佳精度时,FGI-Net相较于GazeTR训练迭代次数分别减少25%和37.5%。
引用
@article{arxiv.2411.18064,
title = {Lightweight Gaze Estimation Model Via Fusion Global Information},
author = {Zhang Cheng and Yanxia Wang},
journal= {arXiv preprint arXiv:2411.18064},
year = {2026}
}