中文

Piculet:面向多模态大语言模型的专用模型引导幻觉减少方法

人工智能 2024-08-05 v1

摘要

多模态大语言模型(MLLM)在弥合视觉与语言模态之间的差距方面取得了显著进展。然而,MLLM 中的幻觉现象——即生成的文本与图像内容不一致——仍然是一个主要挑战。现有解决幻觉的方法通常依赖指令微调,这需要针对特定数据重新训练模型,从而进一步增加了使用 MLLM 的成本。在本文中,我们提出了一种名为 Piculet 的新型免训练方法,用于增强 MLLM 的输入表示。Piculet 利用多个专用模型从输入图像中提取视觉信息描述,并将这些描述与原始图像和查询一起作为 MLLM 的输入。我们对方法进行了定量和定性评估,结果表明 Piculet 大幅减少了 MLLM 的幻觉现象。我们的方法可以轻松扩展至不同的 MLLM,同时具有通用性。

关键词

引用

@article{arxiv.2408.01003,
  title  = {Piculet: Specialized Models-Guided Hallucination Decrease for MultiModal Large Language Models},
  author = {Kohou Wang and Xiang Liu and Zhaoxiang Liu and Kai Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2408.01003},
  year   = {2024}
}

备注

14 pages, 5 figures