中文

CrossCheckGPT:多模态基础模型的通用幻觉排名

计算与语言 2024-05-24 v1

摘要

多模态基础模型容易产生幻觉,生成与输入矛盾或缺乏事实依据的输出。由于架构、训练数据和指令微调技术的多样性,系统对幻觉的敏感性可能存在很大差异。为了评估系统的幻觉鲁棒性,已经针对特定任务(如图像描述、问答、摘要或传记生成)开发了幻觉排名方法。然而,这些方法通常将模型输出与黄金标准参考或标签进行比较,限制了新领域的幻觉基准测试。本文提出“CrossCheckGPT”,一种用于多模态基础模型的无参考通用幻觉排名方法。CrossCheckGPT的核心思想是,相同的幻觉内容不太可能由不同的独立系统生成,因此跨系统一致性可以提供有意义且准确的幻觉评估分数。CrossCheckGPT可应用于任何模型或任务,前提是输出之间的信息一致性可以通过适当的距离度量来衡量。专注于生成文本的多模态大语言模型,我们探索了两种信息一致性度量:CrossCheck-explicit和CrossCheck-implicit。我们展示了我们的方法在跨多种模态(即文本、图像和视听领域)的幻觉排名中的适用性。此外,我们提出了第一个视听幻觉基准“AVHalluBench”,并展示了CrossCheckGPT的有效性,在MHaluBench和AVHalluBench上分别达到了98%和89%的人类判断相关性。

关键词

引用

@article{arxiv.2405.13684,
  title  = {CrossCheckGPT: Universal Hallucination Ranking for Multimodal Foundation Models},
  author = {Guangzhi Sun and Potsawee Manakul and Adian Liusie and Kunat Pipatanakul and Chao Zhang and Phil Woodland and Mark Gales},
  journal= {arXiv preprint arXiv:2405.13684},
  year   = {2024}
}

备注

21 pages. Preprint