中文

别与幻觉决斗,使用它们:基于 NLI 估计图像真实性

计算机视觉与模式识别 2025-03-21 v1 人工智能 计算与语言

摘要

量化图像的真实性在人工智能领域仍是一个具有挑战性的问题。例如,一张拥有阿尔伯特·爱因斯坦持有智能手机的照片违反了常识,因为现代智能手机是在爱因斯坦去世后才发明的。我们提出了一种新方法,用于评估图像的真实性,利用大型视觉语言模型 (LVLMs) 和自然语言推理 (NLI)。我们的方法基于以下假设:当面对违反常识的图像时,LVLMs 可能会生成幻觉。通过使用 LVLMs 从这些图像中提取原子事实,我们获得一组准确的事实和错误的幻觉。随后,我们计算这些事实之间的两两蕴含得分,然后聚合这些值以获得单个现实得分。这一过程用于识别真实事实与幻觉元素之间的矛盾,从而标识违反常识的图像。我们的方法在 WHOOPS! 数据集上以零样本模式下实现了新的状态突破性能。

关键词

引用

@article{arxiv.2503.15948,
  title  = {Don't Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts},
  author = {Elisei Rykov and Kseniia Petrushina and Kseniia Titova and Alexander Panchenko and Vasily Konovalov},
  journal= {arXiv preprint arXiv:2503.15948},
  year   = {2025}
}

备注

Proceedings of De-Factify 4: 4nd Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI-2025