中文

嵌入式指令视觉改变视觉语言模型中的幻觉

计算机视觉与模式识别 2025-08-05 v1 人工智能

摘要

视觉语言模型(VLM)常因对多模态信息的对齐挑战而出现幻觉。我们提出了Prompt-in-Image方法,将文本指令直接嵌入图像中。这一方法无需单独的文本输入,迫使模型通过视觉通道处理所有内容。我们在三个流行的开源VLM上评估了该方法:Qwen2.5-VL、LLaVA-1.5和InstructBLIP。结果显示明显差异:Prompt-in-Image提高了Qwen2.5-VL的性能,将POPE准确率从80.2%提升至84.3%,并在MS-COCO上减少了幻觉率。相比之下,LLaVA-1.5和InstructBLIP经历严重性能下降,准确率从约84%跌至接近随机水平。通过详细分析,我们发现LLaVA和InstructBLIP中的基于CLIP的编码器对嵌入文本区域的注意力偏差过大,扰乱了视觉理解。相比之下,Qwen的视觉编码器对文本嵌入图像表现出鲁健性。关键的是,Prompt-in-Image减少了Qwen的模态间隙,通过统一通过单一模态处理信息来增强跨模态对齐。

关键词

引用

@article{arxiv.2508.01678,
  title  = {Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models},
  author = {Zhaochen Wang and Yiwei Wang and Yujun Cai},
  journal= {arXiv preprint arXiv:2508.01678},
  year   = {2025}
}

备注

Work in progress