针对视觉语言模型中经典错觉的 illusion-aware 视觉预处理与反错觉提示
计算机视觉与模式识别
2026-05-12 v1
摘要
视觉语言模型(VLM)表现出对视觉错觉的系统性偏差,倾向于回忆记忆中已存储的事实,而非感知实际的视觉差异。本文提出了一种面向 CVPR 2026 第 5 届 DataCV 挑战任务 1 的训练-free 框架,通过三种互补策略来解决感知与记忆之间的冲突:(1) 基于类型特定变换(边缘提取、颜色分离、形态学处理和参考线叠加)的 illusion-aware 图像预处理,以削弱错觉诱导的上下文;(2) 反错觉提示工程引导 VLM 进行定性视觉比较;(3) 多数投票集成进一步提高鲁棒性。我们的方法在使用 Claude(claude-opus-4-6)进行 5 投多数投票集成时,准确率达到官方 630 张图像测试集的 90.48%,在人工验证子集上达到 98.41%。该方法无需微调,仅依赖视觉操作和提示设计。我们的解决方案在挑战中获得了第 2 名成绩,仅落后 0.47% 即获第 1 名。代码已在 https://github.com/jasminezz/sf-illusion-aware-vlm.git 上提供。
引用
@article{arxiv.2605.08841,
title = {Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models},
author = {Junli Zha and Jiahui Wang and Xinkai Lu and Jinbo Wang},
journal= {arXiv preprint arXiv:2605.08841},
year = {2026}
}
备注
Accepted at CVPR 2026 Workshop on 5th DataCV Challenge