中文

学习在学习之前观察:将人类视觉认知融入审美质量评估

计算机视觉与模式识别 2026-04-20 v1

摘要

自动化审美质量评估(AQA)将图像主要视为静态像素向量,主要通过语义感知与人类评分一致。然而,这一范式与人类审美认知不同,后者源于由扫描路径塑造的动态视觉探索,受处理流畅性以及底向显著性与顶向意图之间的相互作用影响。在本文中,我们引入AestheticNet,这是一种新颖的认知感知式AQA范式,其集成了人类类似的视觉认知与语义感知,并采用两种路径架构。视觉注意力路径作为基于注视对齐的视觉编码器(GAVE)实现,预先在眼动数据上使用资源高效的方法进行训练,建模来自人类视觉系统的注意力。这一路径通过跨注意力融合来增强语义路径,而语义路径使用诸如CLIP等固定语义编码器。视觉注意力提供一种认知先验,反映前景/背景结构、颜色级联、亮度和照明,这些都是超越语义的审美感知决定因素。通过假设检验验证的实验显示,与仅使用语义的基线方法相比,本方法表现出一致的改进,表明注视模块作为一种模型无关的纠正器与多样的AQA Backbone兼容,支持人类类似的视觉认知对AQA的必要性和模块性。我们的代码可在https://github.com/keepgallop/AestheticNet上获取。

关键词

引用

@article{arxiv.2604.15853,
  title  = {Learning to Look before Learning to Like: Incorporating Human Visual Cognition into Aesthetic Quality Assessment},
  author = {Liwen Yu and Chi Liu and Xiaotong Han and Congcong Zhu and Minghao Wang and Sheng Shen},
  journal= {arXiv preprint arXiv:2604.15853},
  year   = {2026}
}

备注

Accepted for Poster Presentation at CogSci 2026