中文

基于 landmarks 的凝视估计:几何是否足够?

计算机视觉与模式识别 2026-03-27 v1 人工智能

摘要

外观基准的凝视估计常依赖深度卷积神经网络(CNN)。这些模型准确但计算昂贵,充当“黑箱”,提供很少的可解释性。基于面部 landmarks 的几何方法是一种轻量级替代方案,但其性能限制和在现代基准测试中的泛化能力仍未得到充分探索。在本研究中,我们对 landmarks 基准凝视估计进行了全面评估。我们引入一个标准化管道,从三个大规模数据集(Gaze360、ETH-XGaze 和 GazeGene)中提取和归一化 landmarks,并训练轻量级回归模型,具体包括Extreme Gradient Boosted树和两种神经网络结构:一种整体多层感知器(MLP)和一种设计用于捕获双眼几何的siamese MLP。我们发现,landmarks 基准模型在同一域内评估中表现较差,可能是由于landmarks 检测器引入的噪声所致。然而,在跨域评估中,所提出的MLP架构显示出与ResNet18基准相当的泛化能力。这些发现表明,稀疏几何特征为稳健的凝视估计编码了足够的信息,为高效、可解释且面向边缘应用的隐私友好型解决方案铺平了道路。源代码和生成的landmarks 基准数据集可在 https://github.com/daniele-agostinelli/LandmarkGaze.git 获取。

关键词

引用

@article{arxiv.2603.24724,
  title  = {Is Geometry Enough? An Evaluation of Landmark-Based Gaze Estimation},
  author = {Daniele Agostinelli and Thomas Agostinelli and Andrea Generosi and Maura Mengoni},
  journal= {arXiv preprint arXiv:2603.24724},
  year   = {2026}
}