中文

能量引导解码用于对象幻觉缓解

计算机视觉与模式识别 2025-07-11 v1

摘要

缓解大型视觉语言模型 (LVM) 中的对象幻觉现象对于其安全部署至关重要。现有方法要么受限于特定解码方法,要么需要对视觉输入进行复杂修改,要么依赖外部模型的知识。本文首先揭示了 LVM 在三个不同的视觉问答 (VQA) 数据集中对“是”类答案比例存在显著不平衡现象。进一步提出一种基于能量的解码方法,通过动态选择来自能量得分最低的层的隐藏状态。该方法简洁而有效,显著降低了对“是”比例的偏差,同时在三个基准测试 (POPE、MME 和 MMVP) 上提升性能。我们的方法在三个常用 LVM 上的三个 VQA 数据集上均实现了准确率和 F1 分数的提升,相较于贪婪解码平均准确率提升 4.82%。此外,平均“是”比例差距缩减 8.81%,表明所提方法不那么偏斜(见图 1)。

关键词

引用

@article{arxiv.2507.07731,
  title  = {Energy-Guided Decoding for Object Hallucination Mitigation},
  author = {Xixi Liu and Ailin Deng and Christopher Zach},
  journal= {arXiv preprint arXiv:2507.07731},
  year   = {2025}
}