中文

Woodpecker:面向多模态大语言模型的幻觉校正方法

计算机视觉与模式识别 2024-12-12 v2 人工智能 计算与语言 机器学习

摘要

幻觉是笼罩在快速发展的多模态大语言模型(MLLMs)之上的巨大阴影,指生成的文本与图像内容不一致的现象。为缓解幻觉,现有研究主要采用指令微调方式,需要使用特定数据重新训练模型。本文另辟蹊径,提出一种名为 Woodpecker 的无训练方法。如同啄木鸟医治树木,它从生成文本中挑出并纠正幻觉。具体而言,Woodpecker 包含五个阶段:关键概念提取、问题构造、视觉知识验证、视觉声明生成和幻觉校正。以事后补救的方式实现,Woodpecker 可轻松服务于不同的 MLLMs,且通过访问五个阶段的中间输出具有可解释性。我们从定量和定性两方面评估 Woodpecker,展示了这一新范式的巨大潜力。在 POPE 基准上,我们的方法相较基线 MiniGPT-4/mPLUG-Owl 在准确率上取得 30.66%/24.33% 的提升。源代码发布于 https://github.com/BradyFU/Woodpecker。

关键词

引用

@article{arxiv.2310.16045,
  title  = {Woodpecker: Hallucination Correction for Multimodal Large Language Models},
  author = {Shukang Yin and Chaoyou Fu and Sirui Zhao and Tong Xu and Hao Wang and Dianbo Sui and Yunhang Shen and Ke Li and Xing Sun and Enhong Chen},
  journal= {arXiv preprint arXiv:2310.16045},
  year   = {2024}
}

备注

Accepted by Science China Information Sciences (SCIS)