中文

基于视野的场景理解图预测场景理解时间的反应时间

偏微分方程分析 2025-05-20 v1

摘要

虽然已有模型可预测任务中如目标搜索和视觉鉴别等情境下的人类反应时间(RT),但开发用于场景理解时间的图像可计算预测器仍是开放挑战。近期视觉语言模型(VLMs)的进展——这些模型可以为任意图像生成场景描述——以及用于比较语言描述的定量指标的可用性,为建模人类场景理解提供了新机会。我们假设人类场景理解的主要瓶颈以及解释场景中反应时间差异的驱动因素是,人类视觉系统的视野特性与场景中任务相关视觉信息的空间分布之间的相互作用。基于这一假设,我们提出一种新型图像可计算模型,将视野视觉处理与VLMs集成,以产生以固定位置为函数的场景理解空间分布图(称为Foveated Scene Understanding Map,或F-SUM),以及聚合F-SUM得分。该指标与N=17人的平均RT相关(r=0.47),以及理解场景所需的眼动次数(r=0.51)相关(覆盖277个场景)。F-SUM得分还与N=16人的平均描述准确性相关(r=-0.56),在受时间限制的呈现下。这些相关性显著超过基于语言熵的杂乱度、视觉复杂性和场景模糊度等标准图像指标。总体而言,我们的工作引入了一种新的图像可计算指标,用于预测场景理解中人类反应时间,并证明了视野视觉处理在塑造理解难度方面的重要性。

关键词

引用

@article{arxiv.2505.12659,
  title  = {Two-sided Gaussian estimates for fundamental solutions of second-order parabolic equations in non-divergence form},
  author = {Seick Kim and Sungjin Lee and Georgios Sakellaris},
  journal= {arXiv preprint arXiv:2505.12659},
  year   = {2025}
}

备注

9 pages, 3 figures