Pelican:通过主张分解和程序思维验证纠正视觉-LLM中的幻觉
计算与语言
2024-10-30 v2
摘要
大型视觉语言模型(Large Visual Language Models,LVLMs)在视觉指令跟随任务中难以处理幻觉问题,这限制了其可信度和实际应用性。我们提出Pelican——一个新框架,用于通过主张验证来检测和缓解幻觉。Pelican首先将视觉主张分解为基于一阶谓词的子主张链。这些子主张由(谓词、问题)对组成,可被概念化为计算图中的节点。我们随后使用程序思维(Program-of-Thought)提示生成用于通过灵活组合外部工具来回答这些问题的Python代码。Pelican通过引入(1)用于精确 grounding 对象实例的中间变量,以及(2)用于回答子问题以实现自适应纠正和不一致性识别的共享计算来超越前期工作。最后,我们利用LLMs的推理能力,通过考虑来自每个子主张的(问题、答案)对的一致性和置信度来验证主张的正确性。我们的实验显示,幻觉率降低约8%-32%(取决于基准LVLMs),相较于针对MMHal-Bench上提出的缓解幻觉的方法实现了27%的降幅。结果在其他两个基准数据集上进一步证实了我们的发现。
引用
@article{arxiv.2407.02352,
title = {Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification},
author = {Pritish Sahu and Karan Sikka and Ajay Divakaran},
journal= {arXiv preprint arXiv:2407.02352},
year = {2024}
}