中文

SMSP:多尺度感知策略用于 MLLMs 感知视觉幻觉

计算机视觉与模式识别 2026-03-25 v1 多媒体

摘要

最近的研究表明,多模态大语言模型(Multimodal Large Language Models, MLLMs)对隐藏模式视觉幻觉极其脆弱,其中隐藏内容对模型而言不可见,但对人类而言却明显可见。这一缺陷凸显了当前 MLLMs 与人类之间感知上的错位,也潜在引入安全风险。为系统性地调查此类失效,本文引入了 IlluChar,一个全面且具挑战性的幻觉数据集,并揭示了模型失败的关键底层机制:高频注意力偏置(high-frequency attention bias),即模型容易被幻觉图像中高频背景纹理所分散,导致它们忽略隐藏模式。为解决此问题,本文提出了多尺度感知策略(Strategy of Multi-Scale Perception, SMSP),一个即插即用的框架,旨在与人类视觉感知策略相吻合。通过抑制干扰性的高频背景,SMSP 生成更接近人类感知的图像。我们的实验表明,SMSP 在幻觉图像上显著提升了所有评估 MLLMs 的性能,例如,将 Qwen3-VL-8B-Instruct 的准确率从 13.0% 提升至 84.0%。本工作提供了关于 MLLMs 视觉感知的新见解,并提供了一个实用且稳健的解决方案来增强其感知能力。我们的代码已公开发布于 https://github.com/Tujz2023/SMSP。

关键词

引用

@article{arxiv.2603.23118,
  title  = {SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions},
  author = {Jinzhe Tu and Ruilei Guo and Zihan Guo and Junxiao Yang and Shiyao Cui and Minlie Huang},
  journal= {arXiv preprint arXiv:2603.23118},
  year   = {2026}
}