三重反事实 VLM:一种因果视角的幻觉消除方法
计算机视觉与模式识别
2025-03-18 v2 人工智能
摘要
视觉语言模型 (VLMs) 推动了图像描述、视觉问答和推理等多模态任务的发展。然而,它们经常生成与视觉上下文或提示不一致的幻觉输出,限制了其在自动驾驶和医学成像等关键应用中的可靠性。现有研究将幻觉与统计偏差、语言先验和有偏特征学习联系起来,但缺乏结构化的因果理解。在这项工作中,我们引入了因果视角来分析和缓解 VLM 中的幻觉。我们假设幻觉源于视觉或文本模态中绕过正常多模态融合的意外直接效应。为了解决这个问题,我们构建了 VLM 的因果图,并采用反事实分析来估计视觉、文本及其跨模态交互对输出的自然直接效应 (NDE)。我们系统地识别并缓解这些意外的直接效应,以确保响应主要由真正的多模态融合驱动。我们的方法包含三个步骤:(1) 设计结构因果图以区分正确的融合路径与虚假的模态捷径;(2) 利用扰动的图像表示、幻觉文本嵌入和退化的视觉输入,估计特定模态和跨模态的 NDE;(3) 实现测试时干预模块,以动态调整模型对每种模态的依赖。实验结果表明,我们的方法在保持任务性能的同时显著减少了幻觉,为提高 VLM 可靠性提供了一个稳健且可解释的框架。为增强可访问性与可复现性,我们的代码已公开发布于 https://github.com/TREE985/Treble-Counterfactual-VLMs。
引用
@article{arxiv.2503.06169,
title = {Treble Counterfactual VLMs: A Causal Approach to Hallucination},
author = {Shawn Li and Jiashu Qu and Yuxiao Zhou and Yuehan Qin and Tiankai Yang and Yue Zhao},
journal= {arXiv preprint arXiv:2503.06169},
year = {2025}
}