中文

当视觉证据模糊时:将面孔现象作为诊断探针用于视觉模型

计算机视觉与模式识别 2026-03-05 v1 人工智能

摘要

当视觉证据模糊不清时,视觉模型必须决定是否将类似人脸的图案解释为有意义的内容。面孔现象(face pareidolia),即在非人脸物体上感知到人脸的现象,提供了一种受控的探针,用于检验这种行为。我们引入一种表示水平诊断框架,用于分析面孔图像中检测、定位、不确定性和偏见在类别、难度和情感方面的表现。在统一的协议下,我们评估了六个模型,涵盖四种表示范式:视觉-语言模型 (VLMs;CLIP-B/32、CLIP-L/14、LLaVA-1.5-7B)、纯视觉分类 (ViT)、通用目标检测 (YOLOv8) 和人脸检测 (RetinaFace)。我们的分析揭示了三种模糊情况下的解释机制。VLMs表现出语义过度激活,系统性地将模糊的非人类区域拉向Human概念,尤其是LLaVA-1.5-7B在负面情感方面产生最强烈且最具自信的过度调用。ViT则遵循不确定性-退让策略,保持较为扩散,却基本保持无偏。基于检测的模型通过保守的先验条件实现低偏见,即使在受控局部化情况下也抑制了面孔响应。这些结果表明,模糊情况下的行为更多由表示选择决定,而非得分阈值;不确定性和偏见是解耦的:低不确定性既可表示安全抑制(如检测器),亦可表示极端过度解释(如VLMs)。因此,面孔现象提供了一种紧凑的诊断工具,以及用于探测和改进视觉-语言系统语义鲁棒性的模糊感知难负样本来源。代码将在发表后公开。

关键词

引用

@article{arxiv.2603.03989,
  title  = {When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models},
  author = {Qianpu Chen and Derya Soydaner and Rob Saunders},
  journal= {arXiv preprint arXiv:2603.03989},
  year   = {2026}
}