中文

在基于大型视觉语言模型 (LVLMs) 的图像描述生成中,更多细节是否总会引入更多幻觉?

计算机视觉与模式识别 2024-06-19 v1 人工智能

摘要

大型视觉语言模型 (Large Vision-Language Models, LVLMs) 在整合视觉和语言上下文以生成详细内容方面表现出色,促进了诸如图像描述生成等应用。然而,使用 LVLMs 生成描述常面临对象幻觉 (object hallucination, OH) 挑战,即输出文本误represent输入图像中的实际对象。虽然先前研究将 OH 归因于包含更多细节,但我们的研究发现现有评估指标存在技术缺陷,导致对模型和关于 OH 的结论不可靠。这引发了一个争议问题:在基于 LVLMs 的图像描述生成中,更多细节是否总会引入更多幻觉?本文通过提出一种新颖的解码策略——差异化束束解码 (Differentiated Beam Decoding, DBD),以及一套可靠的新评估指标:CLIP-Precision、CLIP-Recall 和 CLIP-F1 来回应此争议。DBD 通过一种设计良好的差分得分,将潜在视觉输入中隐藏的大量信息解码为称为单元事实 (unit facts) 的独立语言表示。这种解码通过并行搜索和候选筛选实现。所选单元事实随后被聚合以生成最终描述。我们提出的指标通过比较ground-truth图像区域和生成文本分区的嵌入组来评估图像描述的完整性和准确性。在 Visual Genome 数据集上进行的大量实验表明,我们的方法有效,能够生成详细描述,同时保持较低的幻觉水平。

关键词

引用

@article{arxiv.2406.12663,
  title  = {Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?},
  author = {Mingqian Feng and Yunlong Tang and Zeliang Zhang and Chenliang Xu},
  journal= {arXiv preprint arXiv:2406.12663},
  year   = {2024}
}