细节更少,回答更好:面向VQA的退化驱动提示方法
计算机视觉与模式识别
2026-04-08 v2
摘要
视觉语言模型(VLM)的最新进展显著推动了视觉问答(VQA)的边界。然而,高分辨率细节有时会成为噪声,导致幻觉或推理错误。在本文中,我们提出了退化驱动提示(DDP),一种通过策略性降低图像保真度来迫使模型聚焦于本质结构信息以提升VQA性能的新型框架。我们在两个不同任务上评估了DDP。物理属性针对容易产生人类误判的图像,DDP结合80p下采样、结构化视觉辅助(白色背景掩模和正交线)以及上下文学习(ICL)来校准模型焦点。感知现象针对各种机器易感的视觉异常和错觉,包括视觉异常(VA)、色彩(CI)、运动(MI)、格式塔(GI)、几何(GSI)和视觉错觉(VI)。对于此任务,DDP集成了任务分类阶段与专用工具,如模糊掩模和对比度增强 alongside 下采样。我们的实验结果表明,少即是多:通过有意降低视觉输入质量并提供针对性的结构提示,DDP使VLM能够绕过分散注意力的纹理,在具有挑战性的视觉基准上实现更优的推理准确率。
引用
@article{arxiv.2604.04838,
title = {Less Detail, Better Answers: Degradation-Driven Prompting for VQA},
author = {Haoxuan Han and Weijie Wang and Zeyu Zhang and Yefei He and Bohan Zhuang},
journal= {arXiv preprint arXiv:2604.04838},
year = {2026}
}
备注
Accepted to CVPRW 2026. Project page: https://hhx-jpg.github.io/ddp/ , Code: https://github.com/ziplab/DDP