中文

打破幻觉:多模态解码中正负路径的交汇

机器学习 2026-05-11 v1

摘要

视觉语言模型常因过度依赖语言先验而受物体幻觉困扰,生成与视觉现实相悖的内容。我们提出正负解码,一种无需训练的推理框架,直接在解码过程中进行干预以强制视觉保真度。PND 的提出源于我们在 VLMs 中发现注意力失衡现象,即视觉特征权重不足。该框架引入双路径对比:正路径放大视觉证据,负路径构建反事实以惩罚先验主导的生成。通过在解码过程中对比两条路径的输出,PND 引导生成趋向视觉有据的结果。在 POPE、MME 和 CHAIR 上的实验表明,该方法无需重新训练即达到了 SOTA 性能。

关键词

引用

@article{arxiv.2605.06679,
  title  = {Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding},
  author = {Yubo Jiang and Yitong An and Xin Yang and Abudukelimu Wuerkaixi and Xuxin Cheng and Fengying Xie and Zhiguo Jiang and Cao Liu and Ke Zeng and Haopeng Zhang},
  journal= {arXiv preprint arXiv:2605.06679},
  year   = {2026}
}

备注

Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND