用于探测人类与机器感知的生成语义模糊图像框架
计算机视觉与模式识别
2026-03-27 v1
摘要
经典的鸭子-兔子错觉揭示了当视觉证据模糊不清时,人类大脑必须决定看什么。人类观察者在“鸭子”和“兔子”之间划出界限到底在何处?机器分类器是在同一位置划出界限吗?我们将语义模糊图像用作可解释性探针,以暴露视觉模型如何表示概念之间的边界。我们提出一种受心理物理学制约的框架,通过 CLIP 嵌入空间中的插值生成连续的模糊图像谱,使我们能够精确测量人类和机器分类器所置信的语义边界。使用该框架,我们表明机器分类器更倾向于看到“兔子”,而人类观察者则更贴近用于合成的 CLIP 嵌入,指导比例似乎对人类敏感性影响更大。我们的框架展示了受控的模糊性如何可作为诊断工具,以桥接人类心理物理分析、图像分类和生成图像模型之间的差距,为人类-模型对齐、鲁棒性、模型可解释性和图像合成方法提供了见解。
引用
@article{arxiv.2603.24730,
title = {A Framework for Generating Semantically Ambiguous Images to Probe Human and Machine Perception},
author = {Yuqi Hu and Vasha DuTell and Ahna R. Girshick and Jennifer E. Corbett},
journal= {arXiv preprint arXiv:2603.24730},
year = {2026}
}