中文

Antidote:消除 LVLM 在反事实 presupposition 与对象感知幻觉的统一框架

计算机视觉与模式识别 2025-05-08 v2

摘要

大型视觉语言模型 (LVLMs) 在 various cross-modal tasks 上取得了令人瞩目的成绩。然而,幻觉——即模型生成反事实响应的现象——仍是一个挑战。虽然近期研究试图缓解对象感知幻觉,但它们关注模型的响应生成,忽视了任务问题本身。本文讨论了 LVLMs 在解答反事实 presupposition 问题 (CPQs) 时的脆弱性,即模型容易接受反事实对象的 presupposition 并产生严重的幻觉响应。为此,我们引入“Antidote”,一个统一的、基于合成数据的后训练框架,用于消除上述两种幻觉。它利用合成数据将事实先验融入问题以实现自我纠正,并将消除过程解耦为偏好优化问题。进一步,我们构建了“CP-Bench”,一个新基准,用于评估 LVLMs 正确处理 CPQs 并生成事实响应的能力。应用于 LLaVA 系列模型后,Antidote 可在不依赖更强 LVLMs 或人类反馈的情况下,将 CP-Bench 性能提升 50% 以上,将 POPE 提升 1.8-3.3%,将 CHAIR 与 SHR 提升 30-50%,且未引入显著的灾难性遗忘问题。

关键词

引用

@article{arxiv.2504.20468,
  title  = {Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception},
  author = {Yuanchen Wu and Lu Zhang and Hang Yao and Junlong Du and Ke Yan and Shouhong Ding and Yunsheng Wu and Xiaoqiang Li},
  journal= {arXiv preprint arXiv:2504.20468},
  year   = {2025}
}

备注

Accepted to CVPR 2025