中文

人眼与AI的对视:视频可记忆性中人类注视与模型注意力的比较

计算机视觉与模式识别 2024-11-06 v2

摘要

理解何种因素使视频具有可记忆性在广告或教育技术中有重要应用。为此,我们研究视频可记忆性背后的时空注意力机制。不同于以往融合多种特征的工作,我们采用简单的CNN+Transformer架构,在匹配视频可记忆性预测最优(SoTA)性能的同时,支持对时空注意力的分析。我们将模型注意力与通过小规模眼动追踪研究收集的人类注视注视点进行比较,其中人类执行视频记忆任务。我们揭示了以下发现:(i)定量显著性指标显示,我们仅训练用于预测可记忆性分数的模型展现出与人类注视相似的空间注意力模式,尤其对更具可记忆性的视频。(ii)模型对视频初始帧赋予更高重要性,模仿人类注意力模式。(iii)全景分割显示,相较于出现概率,模型与人类均将更大比例注意力分配给物体(things)而非物质(stuff)。

关键词

引用

@article{arxiv.2311.16484,
  title  = {Seeing Eye to AI: Comparing Human Gaze and Model Attention in Video Memorability},
  author = {Prajneya Kumar and Eshika Khandelwal and Makarand Tapaswi and Vishnu Sreekumar},
  journal= {arXiv preprint arXiv:2311.16484},
  year   = {2024}
}

备注

Accepted to WACV 2025