凭眼睛觅食:人类视线注视动态与深度预测建模
计算机视觉与模式识别
2025-10-13 v1 图像与视频处理
摘要
动物常通过利夫漫步(Lévy walks)具有重尾步长的随机轶迹,以优化稀疏资源环境中的步幅。在本研究中,我们展示了人类视线注视遵循类似动物觅食的动力学。虽然传统模型强调基于图像的显著性,但视线运动的底层时空统计数据仍未得到充分探索。了解这些动力学在注意力建模和基于视觉的界面方面具有广泛应用前景。在本研究中,我们进行了大规模的人类主体实验,40名参与者在不受约束的条件下观看50幅多样化图像,使用高速眼动仪记录了超过400万个注视点。对这些数据的分析显示,人类的视线轶迹也遵循类似动物觅食的利夫漫步。这表明,人类的眼睛是以最优化的有效方式寻找视觉信息的。进一步地,我们训练了一个卷积神经网络(CNN)来预测仅凭图像输入即可从中预测注视热图。该模型准确再现了新图像中显著的注视区域,表明视线行为的关键组成部分可以仅从视觉结构中学习。我们的发现为人类视觉探索遵循类似自然觅食的统计规律提供了新证据,为通过生成和预测框架来建模注视打开了新思路。
引用
@article{arxiv.2510.09299,
title = {Foraging with the Eyes: Dynamics in Human Visual Gaze and Deep Predictive Modeling},
author = {Tejaswi V. Panchagnula},
journal= {arXiv preprint arXiv:2510.09299},
year = {2025}
}