中文

用于统一扫描路径预测的扩散模型人类凝视行为建模

计算机视觉与模式识别 2025-08-01 v1 人工智能

摘要

预测人类凝视扫描路径对于理解视觉注意力至关重要,具有人机交互、自动驾驶和认知机器人等应用。尽管深度学习模型在扫描路径预测方面取得了进展,但大多数现有方法生成的是平均行为,无法捕捉人类视觉探索的变异性。本文提出了ScanDiff,一种新型体系结构,将扩散模型与Vision Transformer结合,以生成多样化且真实的扫描路径。该方法通过利用扩散模型的随机性,显式地建模扫描路径的变异性,产生广泛的合理凝视轨迹。此外,我们引入了文本条件化,以实现任务驱动的扫描路径生成,使模型能够适应不同的视觉搜索目标。在基准数据集上的实验表明,ScanDiff 在自由观察和任务驱动场景中均超越了最先进的方法,生成更具多样性和准确性的扫描路径。这些结果凸显了其能够更好地捕捉人类视觉行为的复杂性,推动了凝视预测研究的发展。源代码和模型可在 https://aimagelab.github.io/ScanDiff 公开获取。

关键词

引用

@article{arxiv.2507.23021,
  title  = {Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction},
  author = {Giuseppe Cartella and Vittorio Cuculo and Alessandro D'Amelio and Marcella Cornia and Giuseppe Boccignone and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2507.23021},
  year   = {2025}
}

备注

Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025