中文

VIGIL:面向大型多模态模型的数据集与框架,解决图像再语境化中的幻觉检测问题

计算机视觉与模式识别 2026-02-17 v1

摘要

我们提出了 VIGIL(Visual Inconsistency & Generative In-context Lucidity),这是第一个为大型多模态模型(LMM)在图像再语境化任务中提供细粒度分类幻觉的基准数据集和框架。虽然现有研究常将幻觉视为统一问题,但我们的工作在多模态评估方面存在显著空白,通过将这些错误分解为五类来加以 addressing:粘贴对象幻觉、背景幻觉、对象遗漏、位置与逻辑不一致,以及物理法则违反。为应对这些复杂性,我们提出了多阶段检测管道。该架构通过一系列针对对象级忠实性、背景一致性和遗漏检测的专门步骤处理再语境化后的图像,利用协调的开源模型组合,其有效性通过大量实验评估得出。我们的ethods 能深入理解模型在何处失败并提供解释;因此,我们填补了该领域的空白,因为目前尚无先前方法为此任务提供如此细分类和分解。为促进透明度和进一步探索,我们公开了 VIGIL,以及检测管道和基准代码,通过 GitHub 仓库:https://github.com/mlubneuskaya/vigil 和数据仓库:https://huggingface.co/datasets/joannaww/VIGIL。

关键词

引用

@article{arxiv.2602.14633,
  title  = {VIGIL: Tackling Hallucination Detection in Image Recontextualization},
  author = {Joanna Wojciechowicz and Maria Łubniewska and Jakub Antczak and Justyna Baczyńska and Wojciech Gromski and Wojciech Kozłowski and Maciej Zięba},
  journal= {arXiv preprint arXiv:2602.14633},
  year   = {2026}
}

备注

10 pages, 6 figures, 4 tables. Code and data are available at: https://github.com/mlubneuskaya/vigil and https://huggingface.co/datasets/joannaww/VIGIL