中文

Hal-Eval:面向大型视觉语言模型的通用细粒度幻觉评估框架

人工智能 2024-11-11 v2 计算与语言

摘要

大型视觉语言模型 (LVLMs) 展现出卓越的能力,但在处理图像与其描述之间的不一致性(即幻觉)方面仍面临困难。先前关于 LVLMs 的幻觉评估研究主要从对象、属性和关系层面识别幻觉,却忽略了围绕虚构实体构建整个叙事的复杂幻觉。在本文中,我们引入了一种细化的幻觉分类法,包含一个新类别:事件幻觉。随后,我们利用先进的 LLMs 生成并过滤包含各种类型幻觉的细粒度幻觉数据,特别关注事件幻觉,从而为在我们的通用评估框架内整合判别式和生成式评估方法奠定了基础。所提出的基准测试独特地评估了 LVLMs 应对广泛谱系幻觉的能力,使其成为衡量 LVLMs 处理幻觉效能的可靠且全面的工具。我们将发布我们的代码和数据。

关键词

引用

@article{arxiv.2402.15721,
  title  = {Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models},
  author = {Chaoya Jiang and Hongrui Jia and Wei Ye and Mengfan Dong and Haiyang Xu and Ming Yan and Ji Zhang and Shikun Zhang},
  journal= {arXiv preprint arXiv:2402.15721},
  year   = {2024}
}

备注

Accepted by ACM MM 2024