中文

PhD:一个由 ChatGPT 提示的视觉幻觉评估数据集

计算机视觉与模式识别 2025-04-15 v4 人工智能

摘要

多模态大语言模型会产生幻觉,引发了视觉幻觉评估这一新兴课题。本文贡献了一个由 ChatGPT 提示的视觉幻觉评估数据集,用于大规模的客观 VHE。VHE 的本质是向 MLLM 提出关于特定图像的问题,以评估其产生幻觉的易感性。根据问什么(对象、属性、情感等)以及如何提问,我们沿着两个维度构建 PhD,即任务和模式。考虑了五项视觉识别任务,从低级(对象/属性识别)到中级(情感/位置识别和计数)。除了我们称之为 PhD-base 的普通视觉问答模式外,PhD 还以似是而非的上下文提问,或以错误的上下文提问,或使用 AI 生成的反常识图像提问。我们通过 ChatGPT 辅助的半自动化流程构建 PhD,包含四个关键模块:特定任务的幻觉项选择、嵌入 hitem 的问题生成、似是而非/错误的上下文生成,以及反常识图像生成。凭借超过 14k 张日常图像、750 张 CCS 图像和总计 102k 个 VQA 三元组,PhD 揭示了 MLLM 在各种模式和任务上表现的显著变异性,为幻觉的本质提供了有价值的见解。因此,PhD 不仅是 VHE 的强大工具,也可能在 MLLM 的完善中发挥重要作用。

关键词

引用

@article{arxiv.2403.11116,
  title  = {PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset},
  author = {Jiazhen Liu and Yuhan Fu and Ruobing Xie and Runquan Xie and Xingwu Sun and Fengzong Lian and Zhanhui Kang and Xirong Li},
  journal= {arXiv preprint arXiv:2403.11116},
  year   = {2025}
}

备注

Accepted by CVPR 2025, Highlight