反事实分割推理:诊断与消除像素级定位幻觉
计算机视觉与模式识别
2026-04-24 v4 人工智能
计算与语言
机器学习
摘要
分割视觉语言模型(Segmentation Vision-Language Models,简称 VLM)在实现基于像素的视觉理解方面取得了显著进展,但仍容易产生像素级定位幻觉,即为错误对象或完全不存在的对象生成掩码。现有评估几乎完全依赖文本或标签扰动,仅检查预测掩码是否匹配查询标签,忽略了幻觉的空间范围和严重程度,因而无法揭示更具挑战性和更常见的视觉驱动型幻觉。为此,我们正式化了反事实分割推理(Counterfactual Segmentation Reasoning,简称 CSR)任务,即模型必须在事实图像中对被引用对象进行分割,在其反事实版本中选择不分割。为支持该任务,我们构建了 HalluSegBench,这是第一个大规模基准,用于使用受控视觉反事实条件诊断指代和推理表达式分割幻觉,同时提供新的评估指标,以衡量幻觉严重程度并区分视觉与语言驱动的失败模式。我们进一步引入了 RobustSeg,通过反事实微调(Counterfactual Fine-tuning,简称 CFT)训练的分割 VLM,以学习何时进行分割,何时选择不进行分割。实验结果表明,RobustSeg 将幻觉降低 30%,同时在 FP-RefCOCO(+/g) 上提升了分割性能。
引用
@article{arxiv.2506.21546,
title = {Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination},
author = {Xinzhuo Li and Adheesh Juvekar and Jiaxun Zhang and Xingyou Liu and Muntasir Wahed and Kiet A. Nguyen and Yifan Shen and Tianjiao Yu and Ismini Lourentzou},
journal= {arXiv preprint arXiv:2506.21546},
year = {2026}
}
备注
Project webpage: https://plan-lab.github.io/hallusegbench/