中文

SIGN:基于统计学信息的凝视网络用于凝视时间预测

计算机视觉与模式识别 2025-01-30 v1 应用统计

摘要

我们提出了 SIGN(Statistically-Informed Gaze Network)的第一个版本,用于预测图像的总凝视时间。我们发展了一个基础统计模型,并推导出其深度学习实现,涉及 CNN 和 Visual Transformer,从而实现对总凝视时间的预测。该模型使我们能够从总凝视时间中推导出所有图像区域上分布为概率的底层凝视模式,其中每个区域的概率代表了在所有可能的扫描路径中被凝视的可能性。我们在 AdGaze3500 数据集上测试了 SIGN(该数据集包含带有总凝视时间的广告图像),以及在 COCO-Search18 数据集上测试(该数据集收集了搜索中的individual-level 凝视模式)。我们展示了 SIGN (1) 在两个数据集上显著优于基于深度学习的最先进基准进行凝视持续时间预测,(2) 能够提供对应于 COCO-Search18 中经验证的凝视模式的合理凝视模式。这些结果表明,SIGN 的第一个版本在凝视时间预测方面具有潜力,值得进一步发展。

关键词

引用

@article{arxiv.2501.17422,
  title  = {SIGN: A Statistically-Informed Gaze Network for Gaze Time Prediction},
  author = {Jianping Ye and Michel Wedel},
  journal= {arXiv preprint arXiv:2501.17422},
  year   = {2025}
}

备注

4 pages, 2 figures