视觉语言模型与人类:感知图像质量评估
计算机视觉与模式识别
2026-03-26 v1 图像与视频处理
摘要
心理生理实验仍是感知图像质量评估 (IQA) 最可靠的方法,但其成本高昂且可扩展性有限,鼓励采用自动化方法。我们调查了视觉语言模型 (VLM) 是否能够在三个图像质量尺度上近似模拟人类感知判断:对比度、彩色度和整体偏好。对六个 VLM(其中四个专有模型和两个开源模型)进行基准测试,与心理生理数据进行比较。本工作通过与人类心理生理数据比较,系统性地评估了 VLM 在感知 IQA 方面的表现。结果揭示了在不同属性下模型性能存在显著差异:对于彩色度(ρ 最高可达 0.93)表现出色,而在对比度方面表现较差。属性加权分析进一步显示,大多数 VLM 在评估整体偏好时对彩色度的权重更高,这与心理生理数据相符。模型内部一致性分析发现了一个反直觉的权衡:最具自我一致性的模型并不一定是最符合人类感知的,这表明响应变异性反映了对场景依赖性感知线索的敏感性。此外,人类-VLM 的一致性在感知可分离性提高后会增加,表明当刺激差异明显时,VLM 更可靠。
引用
@article{arxiv.2603.24578,
title = {Vision-Language Models vs Human: Perceptual Image Quality Assessment},
author = {Imran Mehmood and Imad Ali Shah and Ming Ronnier Luo and Brian Deegan},
journal= {arXiv preprint arXiv:2603.24578},
year = {2026}
}