中文

多模态大语言模型的对比灵敏度:一种类心理物理学的评估

计算机视觉与模式识别 2025-10-15 v2

摘要

理解多模态大语言模型(MLLM)处理低级视觉特征的方式对于评估其感知能力具有重要意义,但目前尚未系统化描述。受人类心理物理学启发,我们提出了一种用于估计 MLLM 对比度灵敏度函数(CSF)的行为方法,将其视为端到端的观察者。模型被查询以结构化提示观察经过滤波特定空间频率的噪声基刺激。从二元语言响应中推导心理测量函数,获取对比度阈值(及 CSF),无需依赖内部激活或基于分类器的代理方法。我们的结果表明,某些模型在形状或尺度上类似于人类 CSF,但没有模型同时捕获两者。我们还发现,CSF 估计对提示措辞高度敏感,表明语言鲁棒性有限。最后,我们展示了 CSF 能预测模型在频率滤波和对抗性条件下的性能。这些发现凸显了不同 MLLM 之间在频率调谐上的系统性差异,并将 CSF 估计确立为可扩展的多模态感知诊断工具。

关键词

引用

@article{arxiv.2508.10367,
  title  = {Contrast Sensitivity in Multimodal Large Language Models: A Psychophysics-Inspired Evaluation},
  author = {Pablo Hernández-Cámara and Alexandra Gomez-Villa and Jose Manuel Jaén-Lorites and Jorge Vila-Tomás and Valero Laparra and Jesus Malo},
  journal= {arXiv preprint arXiv:2508.10367},
  year   = {2025}
}