中文

大型多模态模型的可觉察差异

计算机视觉与模式识别 2025-07-03 v2 图像与视频处理

摘要

可觉察差异(JND)是人类视觉系统能感知的最小变化,已研究数十年。尽管最近的工作将这一研究延伸到机器视觉,但在当前快速发展的大型多模态模型(LMM)时代,针对多个任务和刺激类型的感知边界进行系统性探索仍稀缺,尤其是LMM的感知缺陷未得到充分调查,可能导致安全问题和响应效率不足。本文首次尝试,表明当前LMM存在显著的视觉盲区。为系统量化这一特征,我们提出了新的概念{\bf LMM-JND},并构建了确定性管道。针对发现HVS对齐视觉感知任务中的常见行为,我们深入研究了多个LMM系列,构建了大型数据集VPA-JND,其中包含2.15万张参考图像,覆盖48.9万个刺激,涵盖12种失真类型,以便开展LMM-JND研究。VPA-JND暴露了面向人类视觉水平的SOTA LMM(包括GPT-4o和InternVL2.5系列)在基本比较查询方面的困难,表现显著不足。我们进一步探讨了视觉和语言骨干网络的影响,发现其设计理念之间存在显著相关性,可能指导未来改进LMM以提升其视觉灵敏度。我们的一项研究强调LMM-JND作为研究LMM的独特视角的重要性,以及可预测的LMM-JND对于安全问题至关重要。本工作将在https://github.com/zijianchen98/LMM-JND上公开。

关键词

引用

@article{arxiv.2507.00490,
  title  = {Just Noticeable Difference for Large Multimodal Models},
  author = {Zijian Chen and Yuan Tian and Yuze Sun and Wei Sun and Zicheng Zhang and Weisi Lin and Guangtao Zhai and Wenjun Zhang},
  journal= {arXiv preprint arXiv:2507.00490},
  year   = {2025}
}

备注

19 pages, 19 figures