中文

DiffEye:基于扩散模型的连续眼动数据生成,基于自然图像条件化

计算机视觉与模式识别 2025-10-10 v2

摘要

为预测扫描路径和视野图,已develop多种模型,这些模型通常在扫描路径上进行训练,将眼动行为建模为一系列由 saccade 连接的离散注视点序列,而原始轨迹中所包含的丰富信息往往被忽略。此外,大多数现有方法未能捕捉同一图像下不同人类观察者所观察的变异性。它们通常预测单个固定长度的扫描路径,这与真实世界视觉注意力的内在多样性和随机性相冲突。为此,我们提出了 DiffEye,一个基于扩散模型的训练框架,用于建模自然图像自由观看期间的连续且多样的眼动轨迹。我们的方法基于以视觉刺激为条件的扩散模型,引入了新颖组件,即对应位置嵌入(CPE),将空间注视信息与视觉输入的 patch 级语义特征对齐。通过利用原始眼动轨迹而非依赖扫描路径,DiffEye 捕捉了人类注视行为的内在变异性,并生成高质�、真实的眼动模式,尽管训练数据相对较小。生成的轨迹还可转换为扫描路径和视野图,从而产生更准确反映人类视觉注意力分布的输出。DiffEye 是首个在自然图像上使用扩散模型解决此任务的方法,同时充分利用了原始眼动数据的丰富性。我们的广泛评估表明,DiffEye 不仅在扫描路径生成方面实现了最先进的性能,还首次实现了连续眼动轨迹的生成。项目网页:https://diff-eye.github.io/

关键词

引用

@article{arxiv.2509.16767,
  title  = {DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images},
  author = {Ozgur Kara and Harris Nisar and James M. Rehg},
  journal= {arXiv preprint arXiv:2509.16767},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025