中文

面向大型视觉语言模型的统一幻觉缓解框架

计算机视觉与模式识别 2024-09-26 v1 计算与语言

摘要

幻觉是大型视觉语言模型 (LVLMs) 在长文本生成中常见且难以根除的问题。带有幻觉的生成内容与图像内容部分不一致。为了缓解幻觉,当前的研究要么侧重于模型推理过程,要么侧重于模型生成结果,但它们设计的解决方案有时无法适当处理各种类型的查询以及针对这些查询的生成幻觉。为了准确处理各种幻觉,我们提出了一个用于缓解幻觉的统一框架 Dentist。其核心步骤是首先对查询进行分类,然后根据分类结果执行不同的幻觉缓解过程,就像牙医先观察牙齿再制定计划一样。在简单的部署中,Dentist 可以将查询分类为感知或推理,并轻松缓解答案中潜在的幻觉,这已在我们的实验中得到证明。在 MMbench 上,我们在图像质量这一粗粒度感知视觉问答 (VQA) 任务上,相较于基线 InstructBLIP/LLaVA/VisualGLM 分别实现了 13.44%/10.2%/15.8% 的准确率提升。

关键词

引用

@article{arxiv.2409.16494,
  title  = {A Unified Hallucination Mitigation Framework for Large Vision-Language Models},
  author = {Yue Chang and Liqiang Jing and Xiaopeng Zhang and Yue Zhang},
  journal= {arXiv preprint arXiv:2409.16494},
  year   = {2024}
}

备注

Accepted by TMLR