中文

面向审美对象评估的 Vision Transformer 注意力与人类视觉感知对齐

计算机视觉与模式识别 2025-07-24 v1 人工智能 机器学习

摘要

视觉注意力机制在人类感知和审美评估中发挥着关键作用。近期在 Vision Transformer (ViT) 方面的进展在计算机视觉任务中显示出惊人的能力,但其与人类视觉注意力模式的对齐,尤其是在审美语境中,仍未得到充分探索。本研究探讨了人类视觉注意力与 ViT 注意力机制在评估手工制作对象的相关性。我们对 30 名参与者(9 名女性,21 名男性,平均年龄 24.6 岁)进行了眼动实验,他们观看了 20 件手工制作对象,包括编织袋和姜罐。使用 Pupil Labs 眼动追踪器,我们记录了注视模式并生成表示人类视觉注意力的热力图。同时,我们使用预训练的 ViT 模型进行分析,采用 DINO (自我蒸馏无标签) 提取每个注意力头的注意力图。我们使用 Kullback-Leibler 发散比较了人类和 ViT 注意力分布,参数范围为 sigma=0.1 到 3.0。统计分析显示,在 sigma=2.4±0.03 时注意力分布呈最佳相关性,注意力头 #12 显示出与人类视觉模式最强的对齐。注意力头之间存在显著差异,头 #7 和 #9 显示出与人类注意力最大的偏差 (p<0.05,Tukey HSD 检验)。结果表明,虽然 ViT 具有更全局的注意力模式与人类聚焦注意力不同,但某些注意力头可逼近人类视觉行为,特别是针对特定对象特征如编织袋中的扣子。这些发现表明 ViT 注意力机制在产品设计和审美评估中的潜在应用,同时突显了人类感知与当前 AI 模型之间注意力策略的根本差异。

关键词

引用

@article{arxiv.2507.17616,
  title  = {Vision Transformer attention alignment with human visual perception in aesthetic object evaluation},
  author = {Miguel Carrasco and César González-Martín and José Aranda and Luis Oliveros},
  journal= {arXiv preprint arXiv:2507.17616},
  year   = {2025}
}

备注

25 pages, 15 figures